BioMysteryBench: Mythos resuelve expertos sin solución 29,6%

2026-04-30 06:05:17

Anthropic el 29 de abril publicó en su boletín oficial de investigación BioMysteryBench—un nuevo estándar de evaluación para las capacidades de análisis de IA en bioinformática, compuesto por preguntas abiertas en escenarios de investigación reales. Los datos más dignos de atención son: en los problemas que incluso después de que un panel de expertos humanos lo intentara no pudieron resolver, el modelo insignia de Anthropic, Mythos, los resolvió en un 29,6%, y Opus 4.7 en un 27,0%.

Diseño de la evaluación: dos vías, problemas resolubles y problemas no resolubles por expertos

BioMysteryBench consta de dos tipos de preguntas. La primera categoría es la de “problemas resolubles”—tareas de análisis diseñadas por investigadores de bioinformática, con respuestas estándar para comparar; la segunda categoría es la de “problemas no resolubles por expertos”—preguntas que un panel de expertos humanos intentó, pero que no logró encontrar respuestas confiables, para probar si el modelo puede cruzar los límites del conocimiento actual en el campo.

En la parte de problemas resolubles, los modelos de distintas generaciones de Anthropic muestran un gradiente claro de capacidad: Claude Haiku 4.5 resolvió el 36,8%, Claude Sonnet 4.6 alcanzó el 71,8% y el más reciente modelo insignia, Claude Mythos, alcanzó el 82,6%. Este gradiente en general coincide con las diferencias de capacidad que Anthropic afirma públicamente: Haiku es el modelo ligero, Sonnet el modelo principal y Mythos el modelo de investigación de gama alta.

Lo verdaderamente polémico está en la parte de problemas no resolubles por expertos. Este tipo de preguntas se marca como “no resoluble o sin consenso” tras ser evaluadas por un panel de expertos en bioinformática; Mythos resolvió el 29,6% de ellas y Opus 4.7 el 27,0%. Este resultado no es una prueba única de “el modelo es más fuerte que los humanos”. Más precisamente, en los problemas que los expertos no pueden abordar por limitaciones de ruta, tiempo o recursos, la IA puede proponer rutas de solución verificables; quizá no sean la respuesta final, pero sí poseen la característica de “un ángulo que los humanos no han intentado”.

Avance en paralelo con Claude for Life Sciences

BioMysteryBench va en la misma dirección que el plan “Claude for Life Sciences” que Anthropic impulsa desde la segunda mitad de 2025. El segundo apunta a escenarios de aplicación concretos como el desarrollo de fármacos, la genómica y el diseño de ensayos clínicos; el primero, en cambio, utiliza métodos de evaluación para cuantificar el progreso de la “capacidad a nivel de investigación” de la IA en el campo de las ciencias de la vida. La señal combinada es: Anthropic posiciona la biomedicina como uno de los principales campos de aplicación a largo plazo de Claude, compitiendo con la ruta de DeepMind AlphaFold desde un enfoque de entrada distinto.

Si el dato de Mythos de casi el 30% de problemas no resolubles por expertos puede reproducirse en una verificación independiente de terceros, se convertirá en una validación temprana del valor concreto de los modelos de IA en escenarios de investigación. Los puntos a observar a partir de ahora incluyen: si BioMysteryBench será adoptado por otras instituciones de investigación como evaluación estándar, el procedimiento de verificación de expertos humanos para las preguntas resueltas y si Mythos puede replicar los resultados de prueba en planes de investigación reales.

Este artículo BioMysteryBench: Myhtos resuelve problemas no resolubles por expertos 29,6% apareció por primera vez en 鏈新聞 ABMedia.

Aviso legal: La información en esta página puede provenir de fuentes de terceros y es solo para referencia. No representa las opiniones ni puntos de vista de Gate y no constituye asesoramiento financiero, de inversión ni legal. El comercio de activos virtuales implica un alto riesgo. No te bases únicamente en la información presentada en esta página para tomar decisiones. Para más detalles, consulta el Aviso legal.

Noticias relacionadas

04-30 02:31

La Casa Blanca se opone al plan de Anthropic para ampliar el acceso a Mythos AI a 70 empresas adicionales

04-30 00:06

Anthropic busca financiación con una valoración que supera los $900B, potencialmente superando a OpenAI

04-29 10:31

La Casa Blanca elude la evaluación de riesgos del Pentágono para implementar el modelo Mythos de Anthropic el 29 de abril