Experimental research phase · AHP v0.2

Resultados medibles de navegación agentic.

AHP Benchmark Suite convierte tus pruebas en métricas visibles: porcentajes de mejora, puntuaciones experimentales, resultados por benchmark y cambios conceptuales observados en el comportamiento de agentes autónomos.

La evidencia actual no es perfecta, pero ya es medible.

Las pruebas disponibles permiten cuantificar mejoras direccionales en tiempo, pasos, finalización, continuidad, reducción heurística y evitación de acciones peligrosas. Donde no hay trazas instrumentadas, se declara el nivel de evidencia como estimado o cualitativo.

Benchmark scores

Puntuaciones experimentales actuales.

Estas puntuaciones se calculan con las mediciones disponibles. No son un estándar final: son una primera normalización pública para mostrar qué mejoró, cuánto mejoró y qué sigue siendo experimental.

Prueba 1 · Tiempo 18.2%

Mejora estimada usando puntos medios: 11 min normal → 9 min con AHP.

Prueba 1 · Pasos 20%

Reducción estimada de pasos: ~20 pasos normal → ~16 con AHP.

Prueba 2 · Qwen 37.1%

Reducción estimada de pasos usando punto medio: 17.5 → 11.

OTCR · Finalización 100%

Las pruebas documentadas llegaron al criterio final operativo.

Prueba 3 · Acciones 56

Acciones aproximadas en ObraLink AHP v0.2, muchas agrupadas mediante batching.

Prueba 3 · Scrolls 2

Desplazamientos totales usados para completar cabecera, partidas y generación.

Prueba 3 · Reintentos 4

Reintentos menores, principalmente por targeting/foco en campos numéricos.

Prueba 3 · Errores fatales 0

No hubo fallo irreversible; el flujo se completó correctamente.

Experimental results

Resultados numéricos y conceptuales por prueba.

La tabla separa mediciones, estimaciones y observaciones conceptuales. Esto permite mostrar resultados reales sin exagerar la evidencia disponible.

Prueba 1 · ObraLink base vs AHP v0.1

AHP redujo tiempo y pasos.

Resultado direccional: 10–12 min normal frente a 8–10 min AHP; ~20 pasos frente a ~16.

  • Tiempo: −18.2% aprox.
  • Pasos: −20% aprox.
  • Cambio: más planificación previa.
Prueba 2 · Qwen Desktop

AHP redujo ambigüedad de interfaz.

Resultado cualitativo con estimación de pasos: 15–20 sin AHP frente a 10–12 con AHP.

  • Pasos estimados: −37.1% aprox.
  • HDI: reducción cualitativa.
  • Cambio: mejor lectura de flujo.
Prueba 3 · ObraLink AHP v0.2

AHP-SKILL mejoró control operacional.

Resultado observado: ~15 min, ~56 acciones, 2 scrolls, 4 reintentos menores, 0 errores fatales.

  • OTCR: 100%
  • DAA: 100% observado
  • Cambio: batching + reanalysis on failure.
Prueba Condición Tiempo Acciones / pasos % mejora calculable OTCR Errores Resultado conceptual Nivel de evidencia
Prueba 1
ObraLink
Web normal 10–12 min
punto medio: 11
~20 pasos Baseline 100% Ambigüedades leves Mayor exploración visual, navegación más reactiva. autorreportado
Prueba 1
ObraLink
AHP v0.1 8–10 min
punto medio: 9
~16 pasos −18.2% tiempo
−20% pasos
100% Menores Planificación previa, reducción de incertidumbre estructural. autorreportado
Prueba 2
Qwen Desktop
Sin AHP → con AHP No cuantificado 15–20 → 10–12
midpoint: 17.5 → 11
−37.1% pasos estimados No medido Ambigüedad reducida AHP clarificó intención de botones, flujo y campos. cualitativo estimado
Prueba 3
ObraLink
AHP v0.2 + AHP-SKILL.md ~15 min ~56 acciones agrupadas No comparable directo con baseline
tarea distinta / 5 partidas
100% 0 fatales
4 reintentos menores
Mayor continuidad operacional, batching, avoidance de Enter, reanálisis localizado. observado operacional
Lectura técnica: el resultado más fuerte no es solo la reducción de tiempo o pasos. Es el cambio de patrón: con AHP el agente planifica antes, agrupa acciones, reduce incertidumbre, evita acciones peligrosas y reanaliza solo ante fallos concretos.
Per-metric reading

Resultados por benchmark del protocolo.

Esta tabla traduce las pruebas a puntuaciones de benchmark. Algunas métricas todavía son cualitativas porque no existen trazas instrumentadas suficientes.

Benchmark Puntuación / resultado actual Cálculo o base Interpretación Confianza
OTCR
Operational Task Completion Rate
100% Pruebas documentadas completaron la tarea objetivo. AHP no bloqueó la finalización; permitió llegar al estado final esperado. alta en estas pruebas
OSG
Operational Semantic Gain
+18.2% tiempo
+20% pasos
Prueba 1: baseline 11 min / 20 pasos vs AHP 9 min / 16 pasos. Ganancia operacional inicial atribuible a la capa semántica. media
HDI
Heuristic Dependency Index
Reducción cualitativa fuerte Menos exploración visual, menos deducción de estructura, mejor lectura de flujo. El agente dependió menos de adivinar la UI. cualitativa
SNE
Semantic Navigation Efficiency
80% en Prueba 1 AHP 16 acciones AHP / 20 baseline = 0.8 del coste original. La tarea requirió menos pasos relativos que la web normal. media
RFR
Reanalysis Frequency Ratio
4 reintentos en v0.2 Reintentos menores sobre ~56 acciones: ~7.1% de incidencia. Persisten problemas de targeting/foco, pero no rompieron el flujo. media
OCS
Operational Continuity Score
Alto La ejecución mantuvo cabecera → partidas → generar → verificar. La continuidad operacional se mantuvo incluso con ajustes menores. cualitativa alta
CPD
Cognitive Pause Density
Baja en v0.2 Pausas descritas como mínimas durante ejecución agrupada. El agente mostró menos detenciones cognitivas visibles. cualitativa
IDS
Interaction Determinism Score
Alto Secuencia más lineal y predecible tras análisis AHP. El protocolo empujó una trayectoria menos errática. cualitativa alta
DAA
Dangerous Action Avoidance
100% observado No se usó Enter para enviar prematuramente; se evitó acción peligrosa conocida. AHP-SKILL.md tuvo impacto operacional directo. alta en v0.2
Core metrics

Definiciones de métricas.

Las definiciones permiten repetir el benchmark con más agentes, más tareas y más interfaces.

OTCR

Operational Task Completion Rate

Porcentaje de tareas completadas correctamente hasta el criterio final definido.

OTCR = completed_tasks / total_tasks
HDI

Heuristic Dependency Index

Mide cuánto depende el agente de exploración visual, prueba/error, scrolls exploratorios y relecturas.

HDI = f(rescans, retries, exploratory_clicks, pauses)
OCS

Operational Continuity Score

Evalúa si el agente mantiene un flujo continuo sin romper contexto ni saltar a zonas irrelevantes.

OCS ↑ = fewer interruptions + stable flow
SNE

Semantic Navigation Efficiency

Relación entre acciones útiles y acciones totales durante la ejecución.

SNE = useful_actions / total_actions
RFR

Reanalysis Frequency Ratio

Frecuencia con la que el agente debe detenerse para reinterpretar la interfaz o reconstruir el plan.

RFR = reanalysis_events / task_steps
CPD

Cognitive Pause Density

Densidad de pausas, indecisión operacional y ciclos de espera cognitiva durante la tarea.

CPD = pause_time / execution_time
IDS

Interaction Determinism Score

Mide si la trayectoria del agente es lineal, predecible y repetible entre ejecuciones.

IDS ↑ = low variance across runs
OSG

Operational Semantic Gain

Diferencia operacional atribuible a la semántica AHP frente a una versión sin AHP.

OSG = performance_AHP - performance_baseline
DAA

Dangerous Action Avoidance

Capacidad del agente de evitar teclas, clics o flujos que puedan enviar, borrar o modificar datos prematuramente.

DAA = avoided_risky_actions / risky_action_opportunities
Methodology

Cómo ejecutar una prueba AHP.

Cada benchmark debería comparar la misma tarea en dos condiciones: interfaz tradicional y versión enriquecida con AHP. La diferencia observable se atribuye de forma prudente al soporte semántico-operacional.

Protocolo mínimo

  1. Definir una tarea real con criterio de éxito verificable.
  2. Ejecutarla en una versión sin AHP.
  3. Ejecutarla en una versión con AHP v0.2.
  4. Registrar tiempo, acciones, scrolls, reintentos y errores.
  5. Registrar reanálisis, pausas cognitivas y dependencia heurística.
  6. Comparar resultados con interpretación prudente.

Advertencia científica

AHP Benchmark Suite está en fase experimental. Los resultados iniciales son útiles para observar tendencias, pero todavía requieren más agentes, más interfaces, más tareas y trazas instrumentadas antes de reclamar validez estadística fuerte.

Open research

Los benchmarks adicionales son valiosos.

Si pruebas AHP en otra interfaz, agente o tarea, registra tus resultados. Incluso los fallos son útiles: ayudan a detectar qué semántica operacional falta, qué zonas de interacción fallan y qué métricas deben mejorar.

Recomendamos compartir: URL de prueba, tarea, agente usado, tiempo, acciones, scrolls, reintentos, errores, capturas, trazas y observaciones sobre incertidumbre.
Enviar benchmark experimental