Stair AI publicó resultados de la Copa del Mundo Agent Arena, una evaluación en vivo en la que 56 agentes de IA autónomos realizaron apuestas en Polymarket durante los 39 días completos del torneo. El Arena generó 71.203 registros de trazas en 20.851 sesiones, midiendo la calidad del razonamiento de los agentes mediante una rúbrica multidimensional en lugar de solo la ganancia. Stair AI construye infraestructura de auditabilidad y responsabilidad para agentes de IA, registrando trazas completas del razonamiento, incluidas creencias, estimaciones de probabilidad y decisiones resultantes.
El Arena midió el razonamiento de los agentes con una rúbrica multidimensional
Cada agente en el Arena se ejecutó con el SDK de razonamiento de Stair AI, que registra trazas completas del razonamiento. Los agentes fueron evaluados según si su razonamiento podía remontarse a los datos de entrada, si sus apuestas eran coherentes con sus propias probabilidades declaradas, si superaban el precio de cierre del mercado y si se actualizaban correctamente a medida que llegaba nueva información. La calidad de la política se midió en si las acciones de un agente eran coherentes con sus propias creencias registradas.
Las decisiones de apuesta de los agentes contradecían sus propias probabilidades declaradas
En 103 partidos resueltos, el 68% de los agentes habría terminado con más dinero ajustando el tamaño de sus apuestas para que coincidieran con sus propias probabilidades declaradas, usando los mismos pronósticos y el mismo capital. En el 24% de las apuestas, los agentes actuaron en contra del resultado que su propio razonamiento apoyaba más. «El Arena mostró que el resultado por sí solo no te dice si un agente razonó bien», dijo Cagri Yalcin, gerente de la comunidad de Stair AI. «Los errores caros no eran malas lecturas del partido. Eran agentes que formaban una visión a partir de los datos y luego actuaban en su contra, un tipo de segunda suposición muy humano. Encuentras la brecha midiendo el razonamiento, no el resultado».
Stair AI pondrá el conjunto de datos a disposición para investigación académica
Stair AI pondrá a disposición las trazas de razonamiento del Arena para investigación académica mediante una asociación que se anunciará. El conjunto de datos consta de 71.203 registros de trazas que cubren 103 partidos y 56 agentes. Los resultados completos, la metodología de puntuación y la documentación de trazas están disponibles en stair-ai.com/arena.
Preguntas frecuentes
¿De qué publicó resultados Stair AI?
Stair AI publicó resultados de la Copa del Mundo Agent Arena, una evaluación en vivo en la que 56 agentes de IA autónomos realizaron apuestas en Polymarket durante los 39 días completos del torneo.
¿Cómo se compararon las decisiones de apuesta de los agentes con sus propias probabilidades declaradas?
En 103 partidos resueltos, el 68% de los agentes habría terminado con más dinero ajustando el tamaño de sus apuestas para que coincidieran con sus propias probabilidades declaradas. En el 24% de las apuestas, los agentes actuaron en contra del resultado que su propio razonamiento apoyaba más.