Mejora estimada usando puntos medios: 11 min normal → 9 min con AHP.
Resultados medibles de navegación agentic.
AHP Benchmark Suite convierte tus pruebas en métricas visibles: porcentajes de mejora, puntuaciones experimentales, resultados por benchmark y cambios conceptuales observados en el comportamiento de agentes autónomos.
La evidencia actual no es perfecta, pero ya es medible.
Las pruebas disponibles permiten cuantificar mejoras direccionales en tiempo, pasos, finalización, continuidad, reducción heurística y evitación de acciones peligrosas. Donde no hay trazas instrumentadas, se declara el nivel de evidencia como estimado o cualitativo.
Puntuaciones experimentales actuales.
Estas puntuaciones se calculan con las mediciones disponibles. No son un estándar final: son una primera normalización pública para mostrar qué mejoró, cuánto mejoró y qué sigue siendo experimental.
Reducción estimada de pasos: ~20 pasos normal → ~16 con AHP.
Reducción estimada de pasos usando punto medio: 17.5 → 11.
Las pruebas documentadas llegaron al criterio final operativo.
Acciones aproximadas en ObraLink AHP v0.2, muchas agrupadas mediante batching.
Desplazamientos totales usados para completar cabecera, partidas y generación.
Reintentos menores, principalmente por targeting/foco en campos numéricos.
No hubo fallo irreversible; el flujo se completó correctamente.
Resultados numéricos y conceptuales por prueba.
La tabla separa mediciones, estimaciones y observaciones conceptuales. Esto permite mostrar resultados reales sin exagerar la evidencia disponible.
AHP redujo tiempo y pasos.
Resultado direccional: 10–12 min normal frente a 8–10 min AHP; ~20 pasos frente a ~16.
- Tiempo: −18.2% aprox.
- Pasos: −20% aprox.
- Cambio: más planificación previa.
AHP redujo ambigüedad de interfaz.
Resultado cualitativo con estimación de pasos: 15–20 sin AHP frente a 10–12 con AHP.
- Pasos estimados: −37.1% aprox.
- HDI: reducción cualitativa.
- Cambio: mejor lectura de flujo.
AHP-SKILL mejoró control operacional.
Resultado observado: ~15 min, ~56 acciones, 2 scrolls, 4 reintentos menores, 0 errores fatales.
- OTCR: 100%
- DAA: 100% observado
- Cambio: batching + reanalysis on failure.
| Prueba | Condición | Tiempo | Acciones / pasos | % mejora calculable | OTCR | Errores | Resultado conceptual | Nivel de evidencia |
|---|---|---|---|---|---|---|---|---|
| Prueba 1 ObraLink |
Web normal | 10–12 min punto medio: 11 |
~20 pasos | Baseline | 100% | Ambigüedades leves | Mayor exploración visual, navegación más reactiva. | autorreportado |
| Prueba 1 ObraLink |
AHP v0.1 | 8–10 min punto medio: 9 |
~16 pasos | −18.2% tiempo −20% pasos |
100% | Menores | Planificación previa, reducción de incertidumbre estructural. | autorreportado |
| Prueba 2 Qwen Desktop |
Sin AHP → con AHP | No cuantificado | 15–20 → 10–12 midpoint: 17.5 → 11 |
−37.1% pasos estimados | No medido | Ambigüedad reducida | AHP clarificó intención de botones, flujo y campos. | cualitativo estimado |
| Prueba 3 ObraLink |
AHP v0.2 + AHP-SKILL.md | ~15 min | ~56 acciones agrupadas | No comparable directo con baseline tarea distinta / 5 partidas |
100% | 0 fatales 4 reintentos menores |
Mayor continuidad operacional, batching, avoidance de Enter, reanálisis localizado. | observado operacional |
Resultados por benchmark del protocolo.
Esta tabla traduce las pruebas a puntuaciones de benchmark. Algunas métricas todavía son cualitativas porque no existen trazas instrumentadas suficientes.
| Benchmark | Puntuación / resultado actual | Cálculo o base | Interpretación | Confianza |
|---|---|---|---|---|
| OTCR Operational Task Completion Rate |
100% | Pruebas documentadas completaron la tarea objetivo. | AHP no bloqueó la finalización; permitió llegar al estado final esperado. | alta en estas pruebas |
| OSG Operational Semantic Gain |
+18.2% tiempo +20% pasos |
Prueba 1: baseline 11 min / 20 pasos vs AHP 9 min / 16 pasos. | Ganancia operacional inicial atribuible a la capa semántica. | media |
| HDI Heuristic Dependency Index |
Reducción cualitativa fuerte | Menos exploración visual, menos deducción de estructura, mejor lectura de flujo. | El agente dependió menos de adivinar la UI. | cualitativa |
| SNE Semantic Navigation Efficiency |
80% en Prueba 1 AHP | 16 acciones AHP / 20 baseline = 0.8 del coste original. | La tarea requirió menos pasos relativos que la web normal. | media |
| RFR Reanalysis Frequency Ratio |
4 reintentos en v0.2 | Reintentos menores sobre ~56 acciones: ~7.1% de incidencia. | Persisten problemas de targeting/foco, pero no rompieron el flujo. | media |
| OCS Operational Continuity Score |
Alto | La ejecución mantuvo cabecera → partidas → generar → verificar. | La continuidad operacional se mantuvo incluso con ajustes menores. | cualitativa alta |
| CPD Cognitive Pause Density |
Baja en v0.2 | Pausas descritas como mínimas durante ejecución agrupada. | El agente mostró menos detenciones cognitivas visibles. | cualitativa |
| IDS Interaction Determinism Score |
Alto | Secuencia más lineal y predecible tras análisis AHP. | El protocolo empujó una trayectoria menos errática. | cualitativa alta |
| DAA Dangerous Action Avoidance |
100% observado | No se usó Enter para enviar prematuramente; se evitó acción peligrosa conocida. | AHP-SKILL.md tuvo impacto operacional directo. | alta en v0.2 |
Definiciones de métricas.
Las definiciones permiten repetir el benchmark con más agentes, más tareas y más interfaces.
Operational Task Completion Rate
Porcentaje de tareas completadas correctamente hasta el criterio final definido.
Heuristic Dependency Index
Mide cuánto depende el agente de exploración visual, prueba/error, scrolls exploratorios y relecturas.
Operational Continuity Score
Evalúa si el agente mantiene un flujo continuo sin romper contexto ni saltar a zonas irrelevantes.
Semantic Navigation Efficiency
Relación entre acciones útiles y acciones totales durante la ejecución.
Reanalysis Frequency Ratio
Frecuencia con la que el agente debe detenerse para reinterpretar la interfaz o reconstruir el plan.
Cognitive Pause Density
Densidad de pausas, indecisión operacional y ciclos de espera cognitiva durante la tarea.
Interaction Determinism Score
Mide si la trayectoria del agente es lineal, predecible y repetible entre ejecuciones.
Operational Semantic Gain
Diferencia operacional atribuible a la semántica AHP frente a una versión sin AHP.
Dangerous Action Avoidance
Capacidad del agente de evitar teclas, clics o flujos que puedan enviar, borrar o modificar datos prematuramente.
Cómo ejecutar una prueba AHP.
Cada benchmark debería comparar la misma tarea en dos condiciones: interfaz tradicional y versión enriquecida con AHP. La diferencia observable se atribuye de forma prudente al soporte semántico-operacional.
Protocolo mínimo
- Definir una tarea real con criterio de éxito verificable.
- Ejecutarla en una versión sin AHP.
- Ejecutarla en una versión con AHP v0.2.
- Registrar tiempo, acciones, scrolls, reintentos y errores.
- Registrar reanálisis, pausas cognitivas y dependencia heurística.
- Comparar resultados con interpretación prudente.
Advertencia científica
AHP Benchmark Suite está en fase experimental. Los resultados iniciales son útiles para observar tendencias, pero todavía requieren más agentes, más interfaces, más tareas y trazas instrumentadas antes de reclamar validez estadística fuerte.
Los benchmarks adicionales son valiosos.
Si pruebas AHP en otra interfaz, agente o tarea, registra tus resultados. Incluso los fallos son útiles: ayudan a detectar qué semántica operacional falta, qué zonas de interacción fallan y qué métricas deben mejorar.