BLOG

EvoHarness-RL: Cómo un modelo pequeño iguala a Claude Opus 4.5

EvoHarness-RL: Cómo un modelo de 8.000 millones de parámetros logra igualar a Claude Opus 4.5 en tareas agentivas complejas

En el competitivo campo de la inteligencia artificial, la carrera por construir modelos cada vez más grandes y costosos ha dominado los titulares durante años. Sin embargo, una nueva investigación conjunta entre Meta AI y la Universidad de Illinois Urbana-Champaign (UIUC) propone un camino radicalmente diferente: en lugar de escalar el tamaño del modelo, escalar la inteligencia de su entorno de ejecución. El resultado es EvoHarness-RL, un marco de trabajo que permite a un modelo compacto de apenas 8.000 millones de parámetros igualar el rendimiento de Claude Opus 4.5 de Anthropic en tareas agentivas de larga duración. Esta es una de las publicaciones más relevantes del año en el ámbito de los agentes de inteligencia artificial empresarial.

El problema de fondo: los agentes modernos atrapados en entornos rígidos

Para entender la relevancia de este avance, es necesario comprender el desafío que enfrentan los sistemas de IA cuando ejecutan tareas empresariales complejas. Actividades como la migración masiva de bases de datos, las auditorías de cumplimiento normativo o el desarrollo de software a gran escala no pueden resolverse en una sola interacción. Estas tareas se extienden durante horas, días o semanas, y requieren que el agente mantenga un estado coherente a lo largo de cientos o miles de pasos.

El equipo investigador identificó que los harnesses actuales —es decir, los entornos externos que proveen retroalimentación, rastreadores de estado y mecanismos de control de flujo al agente— son construidos manualmente por desarrolladores mediante reglas estáticas y rígidas. Este enfoque presenta tres problemas estructurales graves.

El primero es la falta de autonomía real: el agente sigue un guion predefinido en lugar de razonar de forma independiente sobre el coste y beneficio de cada acción. El segundo es el elevado coste de mantenimiento: cada actualización del modelo subyacente obliga a un nuevo ciclo de ajuste y depuración del entorno de ejecución. El tercero es la degradación por acumulación de memoria: los sistemas de almacenamiento de solo adición acumulan conclusiones obsoletas e información irrelevante que deterioran progresivamente el razonamiento del agente.

Como señala Xuying Ning, coautora del artículo: “El harness óptimo cambia con el modelo. Diferentes modelos pueden necesitar distintos prompts, diseños de memoria, permisos o configuraciones de sandbox. Si toda esta lógica se codifica manualmente, cada actualización del modelo puede desencadenar otro largo ciclo de ajuste y depuración.” Esta observación resume perfectamente por qué el enfoque tradicional no es sostenible a escala empresarial.

La arquitectura BPE: Creencia, Progreso y Experiencia

La propuesta central de EvoHarness-RL es introducir una capa de abstracción sobre el entorno de ejecución del agente, enseñándole mediante aprendizaje por refuerzo cuándo y cómo gestionar la información que obtiene de su entorno. El corazón de esta arquitectura es la interfaz unificada BPE, siglas de Belief, Progress y Experience (Creencia, Progreso y Experiencia).

El componente Belief (Creencia) mantiene una representación precisa del estado actual del entorno. En un contexto de ingeniería de software, esto podría equivaler a la comprensión que tiene el agente sobre la estructura de un repositorio de código; en el ámbito de auditorías financieras, implicaría las normas aplicables y la evidencia recopilada hasta ese momento.

El componente Progress (Progreso) gestiona los subobjetivos completados y pendientes, así como las dependencias entre pasos. Su función principal es evitar que el agente omita pasos críticos o duplique acciones ya realizadas, un problema frecuente en tareas de larga duración.

El componente Experience (Experiencia) almacena conocimiento histórico entre tareas, incluyendo errores cometidos anteriormente y retroalimentación recibida de usuarios. Este módulo convierte cada tarea ejecutada en un activo de aprendizaje reutilizable.

Para interactuar con esta interfaz, el agente dispone de cuatro meta-acciones compactas: track (rastrear el entorno en tiempo real), commit (confirmar actualizaciones del flujo de trabajo), recall (recuperar estrategias pasadas antes de actuar) y note (guardar nuevos hallazgos para usos futuros). Este vocabulario reducido pero expresivo permite al agente gestionar su entorno de forma eficiente sin sobrecargar el espacio de decisiones.

El proceso de entrenamiento en dos etapas

El equipo diseñó una receta de entrenamiento estructurada en dos fases complementarias que trabajan en sinergia para producir un agente capaz y eficiente.

La primera fase es el ajuste fino supervisado del harness. En esta etapa, el modelo base aprende a extraer y estructurar información útil a partir de registros de interacción desordenados, organizándolos en el marco BPE. Es, esencialmente, una fase de comprensión y organización del conocimiento.

La segunda fase es el aprendizaje por refuerzo consciente del coste. Dado que consultar la memoria o actualizar los rastreadores consume tiempo y tokens de cómputo, esta etapa entrena al agente para calcular cuándo el acceso a su estado externo justifica el coste presupuestario. El objetivo es transformar el uso de herramientas de un comportamiento rígido y codificado en una conducta aprendida y adaptativa en tiempo de ejecución. Esta distinción es fundamental: el agente no sigue reglas sobre cuándo consultar su memoria, sino que aprende a decidirlo de forma autónoma.

Los resultados: números que cambian las reglas del juego

Los investigadores validaron EvoHarness-RL utilizando el benchmark ALFWorld, un entorno de texto que evalúa la lógica secuencial y el rastreo de estado en tareas de múltiples pasos. El modelo base empleado fue Qwen3-8B, un modelo de código abierto de 8.000 millones de parámetros desarrollado por Alibaba Cloud.

Los datos son contundentes. El sistema Qwen3-8B equipado con EvoHarness-RL alcanzó una tasa de éxito del 96,9%, frente al 96,4% de Claude Opus 4.5 en sus condiciones estándar. La diferencia es de apenas 0,5 puntos porcentuales a favor del modelo entrenado con el nuevo marco. Para poner esto en perspectiva, sistemas alternativos como SkillRL obtuvieron un 89,9% y SkillOS un 80,2%. El propio Qwen3-8B sin modificaciones, operando con el paradigma ReAct, rondaba el 47,9%, lo que significa que EvoHarness-RL aportó una mejora de aproximadamente 49 puntos porcentuales al mismo modelo base.

Igualmente revelador es el efecto del marco BPE sobre modelos de frontera ya consolidados. Cuando los investigadores aplicaron el harness BPE a modelos congelados sin reentrenamiento, los resultados también mejoraron de forma significativa: GPT-4.1 mejoró 22,1 puntos porcentuales y GPT-5 mejoró 25,7 puntos porcentuales. Esto demuestra que la arquitectura BPE aporta valor universal, independientemente de la escala o el origen del modelo subyacente.

Comportamientos emergentes: inteligencia que no fue programada

Uno de los aspectos más fascinantes del estudio es la aparición de dos comportamientos emergentes durante el entrenamiento por refuerzo que no fueron diseñados explícitamente.

El primero es lo que los investigadores denominan “Harness Annealing” o Recocido del Harness. Al inicio del entrenamiento, el agente consultaba sus módulos de Experience y Progress en prácticamente cada paso del proceso. Sin embargo, a medida que dominaba las acciones rutinarias, redujo activamente su dependencia de herramientas externas, incorporando los patrones exitosos directamente en sus parámetros internos. En un entorno empresarial, esto se traduce en menor latencia y menores costes operativos, ya que el agente deja de consumir tokens consultando bases de datos externas para flujos de trabajo estándar que ya domina de memoria.

Este comportamiento es análogo al aprendizaje humano: un profesional novato consulta constantemente manuales y guías, mientras que un experto actúa de forma intuitiva en situaciones familiares y solo recurre a referencias externas ante situaciones verdaderamente novedosas. EvoHarness-RL reproduce este patrón de maduración cognitiva de forma espontánea.

Implicaciones para las organizaciones empresariales

Las consecuencias prácticas de este avance son enormes para cualquier organización que esté evaluando la adopción de agentes de inteligencia artificial. Hasta ahora, desplegar sistemas capaces de ejecutar tareas complejas y de larga duración implicaba asumir los elevados costes computacionales asociados a modelos de frontera como Claude Opus 4.5 o GPT-5. EvoHarness-RL abre la posibilidad de lograr un rendimiento equivalente con modelos abiertos y de menor coste, reduciendo potencialmente las facturas de inferencia en órdenes de magnitud.

Además, la capacidad del marco para adaptarse automáticamente al modelo subyacente elimina uno de los mayores dolores de cabeza en el ciclo de vida de los sistemas agentivos: el mantenimiento del entorno de ejecución tras cada actualización del modelo. Una organización que adopte este enfoque puede actualizar su modelo base sin necesidad de reescribir manualmente la lógica de orquestación, lo que acelera los ciclos de mejora y reduce costes de ingeniería.

En definitiva, EvoHarness-RL no solo es un avance técnico notable: es una señal clara de que el futuro de los agentes de inteligencia artificial no pasa únicamente por modelos más grandes, sino por entornos de ejecución más inteligentes. La colaboración entre Meta AI y la Universidad de Illinois demuestra que con el marco metodológico adecuado, la eficiencia puede competir de igual a igual con la escala bruta.

De la idea a la estrategia

Las grandes empresas no crecen solo con ideas, sino con ejecución estratégica. En Reinvente diseñamos sistemas de marketing, ventas e inteligencia artificial que convierten tu visión en resultados medibles.

Envíanos un mensaje de WhatsApp

Gerencia
Gerencia

Online

Offline

Asistente
Asistente

Online

Offline