Un nuevo banco de pruebas independiente empata a GPT-6 Astra y Claude Opus 5.5 en la cima de la ciencia asistida por IA
El nuevo Terminal-Bench-Science 0.1, que reproduce 70 flujos de investigación diseñados por expertos, sitúa a Astra con un 63,3% de acierto por delante de Opus 5.5, con un 61,9%, en la evaluación independiente más exigente publicada hasta ahora sobre capacidades científicas.
Setenta tareas de investigación real, no preguntas de examen
Artificial Analysis, el evaluador independiente de referencia del sector, publicó el 25 de septiembre de 2026 los resultados de Terminal-Bench-Science 0.1, un banco de pruebas que ejecuta de nuevo 70 flujos de trabajo de investigación diseñados por expertos, usando su propio sistema de agente mínimo y repitiendo cada tarea tres veces para garantizar consistencia. En esta evaluación, GPT-6 Astra de OpenAI, configurado a máximo esfuerzo, obtuvo un 63,3% de acierto, ligeramente por delante de Claude Opus 5.5 de Anthropic, configurado con razonamiento adaptativo de nivel extra alto, que alcanzó un 61,9%.
El propio banco de pruebas no es una novedad en sí misma: un equipo liderado por investigadores de Stanford ya había publicado su versión 0.1 en agosto de 2026. Lo que aporta de nuevo la publicación de esta semana es la medición independiente y fresca de dos de los modelos más avanzados del momento bajo las mismas condiciones exactas, algo especialmente valioso en un sector donde cada laboratorio tiende a publicar sus propios resultados con su propia metodología.
Un empate que reordena la narrativa de superioridad absoluta
La diferencia de apenas 1,4 puntos porcentuales entre ambos modelos resulta significativa por lo que revela sobre el estado actual de la competencia en IA de frontera: ninguno de los dos laboratorios líderes mantiene una ventaja decisiva sobre el otro en tareas de investigación científica real, un escenario que contrasta con los titulares que cada compañía suele destacar tras sus propios lanzamientos, centrados habitualmente en los benchmarks donde su modelo obtiene mejores resultados. GPT-6 Astra, lanzado el 3 de septiembre como el modelo insignia de OpenAI, ya había sido clasificado por la propia compañía como su primer sistema con capacidad "crítica" en ciberseguridad, mientras que Claude Opus 5.5, la actualización más reciente de la familia de Anthropic, compite de forma directa en el mismo segmento de trabajo científico y profesional de alto nivel.
Por qué este tipo de evaluación importa más que un titular de benchmark
Terminal-Bench-Science se diferencia de otros bancos de pruebas más simples en que reproduce el tipo de trabajo que realmente ejecuta un científico —analizar datos, escribir código experimental, interpretar resultados parciales y decidir el siguiente paso— en lugar de limitarse a preguntas cerradas con una única respuesta correcta. Para las organizaciones que evalúan qué modelo incorporar a sus propios flujos de investigación, este tipo de comparación independiente, repetida y metodológicamente transparente resulta considerablemente más útil que las cifras de rendimiento que cada laboratorio elige destacar en sus propios anuncios de producto.