Este artículo sobre IA de Stanford y Harvard explica por qué la mayoría de los sistemas de «IA de agencia» se sienten impresionantes en las demostraciones y luego se desmoronan por completo en el uso real.

Los sistemas de inteligencia artificial de las agencias se asientan sobre grandes modelos de lenguaje y se conectan a herramientas, memoria y entornos externos. Ya apoyan el descubrimiento científico, el desarrollo de software y la investigación clínica, pero aún luchan con el uso de herramientas poco confiables, una planificación débil a largo plazo y una generalización deficiente. El último trabajo de investigación ‘Adaptación de la IA AgenticDesde Stanford, Harvard y UC Berkeley, Caltech propone una visión unificada de cómo se deben adaptar estos sistemas y mapea los métodos existentes en un marco compacto y matemáticamente definido.

Cómo este trabajo de investigación modela un sistema de inteligencia artificial de agente?

La encuesta de investigación modela un sistema de inteligencia artificial de agente como agente modelo base junto con 3 componentes clave. Un módulo de planificación divide los objetivos en secuencias de acciones, utilizando procedimientos estáticos como la cadena de pensamiento y el árbol de pensamiento, o procedimientos dinámicos como ReAct y Reflexion que reaccionan a la retroalimentación. Un módulo de uso de herramientas conecta al agente con motores de búsqueda web, API, entornos de ejecución de código, protocolos de contexto modelo y automatización del navegador. Un módulo de memoria almacena contexto a corto plazo y conocimiento a largo plazo, a los que se accede mediante generación aumentada de recuperación. La adaptación cambia las señales o parámetros de estos componentes mediante ajuste supervisado, métodos basados ​​en preferencias, como la optimización de preferencias directas, métodos de aprendizaje por refuerzo, como la optimización de políticas proximales y la optimización de políticas relativas al grupo, y técnicas eficientes en parámetros, como la adaptación de rango bajo.

https://arxiv.org/pdf/2512.16301

Cuatro paradigmas de adaptación

El marco define 4 paradigmas de adaptación que combinan 2 opciones binarias. La primera dimensión es el objetivo, adaptación del agente versus adaptación de la herramienta. La segunda dimensión es la señal de monitoreo, la ejecución de la herramienta versus la salida del agente. Esto produce A1 y A2 para adaptar el agente, y T1 y T2 para adaptar herramientas.

A1, Ajuste del agente señalado para la ejecución de la herramienta, optimiza el agente utilizando la retroalimentación derivada de la ejecución de la herramienta. A2, Adaptación del agente señalizado de salida del agente, optimiza el agente utilizando una señal definida solo en sus salidas finales. T1, Adaptación de herramientas independientes del agente, optimiza las herramientas sin referencia a un agente específico. T2, Adaptación de herramientas supervisadas por el agente, optimiza las herramientas bajo la supervisión de un agente fijo.

https://arxiv.org/pdf/2512.16301

A1, aprenda de los comentarios de herramientas verificables

En A1, el agente recibe una entrada x, produce una llamada de herramienta estructurada a, las herramientas devuelven un resultado y, y el objetivo de aprendizaje O_tool mide el éxito de la herramienta, por ejemplo, la corrección de la ejecución o la calidad de la recuperación. El artículo cubre tanto la imitación supervisada de trayectorias exitosas de herramientas como el aprendizaje por refuerzo que utiliza resultados de herramientas verificables como recompensas.

Toolformer, ToolAlpaca y Gorilla ilustran métodos A1 supervisados, ya que cada uno utiliza resultados reales de ejecución de herramientas para construir o filtrar trazas de entrenamiento antes de la emulación. Todos ellos mantienen la señal de monitorización definida a nivel de comportamiento de la herramienta, no a nivel de respuesta final.

DeepRetrieval es un ejemplo central de aprendizaje por refuerzo A1. Enmarca la reformulación de consultas como un proceso de decisión de Markov donde el estado es la consulta del usuario, la acción es una consulta reescrita y la recompensa combina métricas de recuperación como Recall y nDCG, un término de formato y, para texto a SQL, precisión de ejecución de SQL. La política se entrena con optimización de política proximal regularizada de KL y el mismo objetivo cubre la búsqueda de literatura, la respuesta a preguntas del corpus y el texto en SQL.

A2, aprender los resultados finales del agente.

A2 cubre casos en los que el objetivo de optimización de O_agent depende únicamente del resultado final o producido por el agente, incluso cuando el agente utiliza herramientas internamente. La encuesta muestra que el monitoreo por sí solo no es suficiente para enseñar herramientas, porque el agente puede ignorar las herramientas y aún así mejorar la probabilidad. Por lo tanto, los sistemas A2 eficaces combinan el seguimiento de las llamadas a herramientas con el seguimiento de las respuestas finales, o asignan recompensas escasas, como la precisión de la coincidencia exacta, o las propagan a lo largo de la trayectoria.

T1, capacitación de herramientas independientes del agente

T1 congela el agente central y optimiza las herramientas para que sean ampliamente reutilizables. El objetivo de O_tool depende únicamente de los resultados de la herramienta y se mide mediante métricas como la precisión de la recuperación, la calidad de la clasificación, la fidelidad de la simulación o el éxito posterior a la tarea. Las políticas de búsqueda entrenadas en A1, como DeepRetrieval, se pueden reutilizar posteriormente como herramientas T1 dentro de nuevos sistemas de agentes sin modificar el agente principal.

T2, herramientas optimizadas bajo un agente congelado

T2 supone un agente A potente pero fijo, lo cual es común cuando el agente es un modelo básico de código cerrado. La herramienta ejecuta llamadas y devuelve resultados que el agente utiliza para producir o. El objetivo de optimización vuelve a vivir en O_agent, pero los parámetros entrenables pertenecen a la herramienta. El artículo describe el entrenamiento ponderado por calidad, el entrenamiento basado en objetivos y las variantes de aprendizaje por refuerzo que derivan todas las señales de aprendizaje de la herramienta a partir de los resultados finales del agente.

La encuesta trata la memoria a largo plazo como un caso especial de T2. La memoria es un almacenamiento externo escrito y leído por funciones aprendidas, y el agente permanece congelado. Los sistemas T2 recientes incluyen s3, que entrena un buscador de 7 mil millones de parámetros que maximiza una recompensa Gain Beyond RAG definida por un generador congelado, y AgentFlow, que entrena a un programador para orquestar módulos basados ​​en Qwen2.5 en su mayoría congelados utilizando Flow GRPO.

https://arxiv.org/pdf/2512.16301

Contribuciones clave

  • La investigación define un marco preciso de cuatro paradigmas para adaptar la IA agente a través de dos dimensiones, ya sea que la adaptación se dirija al agente o a las herramientas, y si la señal de supervisión proviene de la ejecución de la herramienta o de los resultados finales del agente.
  • Los métodos A1, como Toolformer, ToolAlpaca, Gorilla y DeepRetrieval, adaptan el agente directamente en función de comentarios verificables de la herramienta, incluidas métricas de recuperación, precisión de ejecución de SQL y resultados de ejecución de código, a menudo optimizados con optimización de política proximal regularizada de KL.
  • Los métodos A2 optimizan el agente en función de las señales de las salidas finales, p. precisión de la respuesta, y el documento muestra que los sistemas aún necesitan monitorear las llamadas a herramientas o propagar recompensas escasas a través de trayectorias completas; de lo contrario, el agente puede ignorar las herramientas y al mismo tiempo mejorar la probabilidad.
  • T1 y T2 trasladan el aprendizaje a herramientas y memoria, T1 entrena recuperadores, buscadores y simuladores generalmente útiles independientemente de un agente específico, mientras que T2 adapta herramientas bajo un agente congelado, como en s3 y AgentFlow, donde un generador fijo supervisa un buscador y programador aprendido.
  • El equipo de investigación presenta un panorama de adaptación que relaciona el control monolítico versus modular y local versus sistémico, y argumentan que los sistemas prácticos combinarán actualizaciones raras de A1 o A2 en un modelo base sólido con frecuentes adaptaciones T1 y T2 de recuperadores, políticas de búsqueda, simuladores y memoria para lograr robustez y escalabilidad.

Consulta el papel i repositorio de GitHub. Además, no dudes en seguirnos. Gorjeo y no olvides unirte al nuestro SubReddit de más de 100.000 ml y suscríbete nuestro boletín. ¡Esperar! ¿Estás en Telegram? ahora también puedes unirte a nosotros en Telegram.


Michal Sutter es un profesional de la ciencia de datos con una maestría en ciencia de datos de la Universidad de Padua. Con una sólida base en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en la transformación de conjuntos de datos complejos en conocimientos prácticos.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *