En directo
Todas
Modelos & Herramientas IA
IA en el Trabajo & Productividad
IA & Sociedad: Etica y Regulacion
Ciencia & Investigacion IA
Negocio, Inversion & Estrategia IA

Un nuevo banco de pruebas independiente empata a GPT-6 Astra y Claude Opus 5.5 en la cima de la ciencia asistida por IA

El nuevo Terminal-Bench-Science 0.1, que reproduce 70 flujos de investigación diseñados por expertos, sitúa a Astra con un 63,3% de acierto por delante de Opus 5.5, con un 61,9%, en la evaluación independiente más exigente publicada hasta ahora sobre capacidades científicas.

✍️ Administrador 📅 26 de September de 2026 ⏱ 2 min de lectura 👁 0 visitas
Dos esferas de luz violeta y verde a la misma altura conectadas por una línea de equilibrio dorada, composición editorial sobre el empate entre GPT-6 Astra y Claude Opus 5.5 en el nuevo banco de prueb

Setenta tareas de investigación real, no preguntas de examen

Artificial Analysis, el evaluador independiente de referencia del sector, publicó el 25 de septiembre de 2026 los resultados de Terminal-Bench-Science 0.1, un banco de pruebas que ejecuta de nuevo 70 flujos de trabajo de investigación diseñados por expertos, usando su propio sistema de agente mínimo y repitiendo cada tarea tres veces para garantizar consistencia. En esta evaluación, GPT-6 Astra de OpenAI, configurado a máximo esfuerzo, obtuvo un 63,3% de acierto, ligeramente por delante de Claude Opus 5.5 de Anthropic, configurado con razonamiento adaptativo de nivel extra alto, que alcanzó un 61,9%.

El propio banco de pruebas no es una novedad en sí misma: un equipo liderado por investigadores de Stanford ya había publicado su versión 0.1 en agosto de 2026. Lo que aporta de nuevo la publicación de esta semana es la medición independiente y fresca de dos de los modelos más avanzados del momento bajo las mismas condiciones exactas, algo especialmente valioso en un sector donde cada laboratorio tiende a publicar sus propios resultados con su propia metodología.

Un empate que reordena la narrativa de superioridad absoluta

La diferencia de apenas 1,4 puntos porcentuales entre ambos modelos resulta significativa por lo que revela sobre el estado actual de la competencia en IA de frontera: ninguno de los dos laboratorios líderes mantiene una ventaja decisiva sobre el otro en tareas de investigación científica real, un escenario que contrasta con los titulares que cada compañía suele destacar tras sus propios lanzamientos, centrados habitualmente en los benchmarks donde su modelo obtiene mejores resultados. GPT-6 Astra, lanzado el 3 de septiembre como el modelo insignia de OpenAI, ya había sido clasificado por la propia compañía como su primer sistema con capacidad "crítica" en ciberseguridad, mientras que Claude Opus 5.5, la actualización más reciente de la familia de Anthropic, compite de forma directa en el mismo segmento de trabajo científico y profesional de alto nivel.

Por qué este tipo de evaluación importa más que un titular de benchmark

Terminal-Bench-Science se diferencia de otros bancos de pruebas más simples en que reproduce el tipo de trabajo que realmente ejecuta un científico —analizar datos, escribir código experimental, interpretar resultados parciales y decidir el siguiente paso— en lugar de limitarse a preguntas cerradas con una única respuesta correcta. Para las organizaciones que evalúan qué modelo incorporar a sus propios flujos de investigación, este tipo de comparación independiente, repetida y metodológicamente transparente resulta considerablemente más útil que las cifras de rendimiento que cada laboratorio elige destacar en sus propios anuncios de producto.

Compartir:
Noticias relacionadas
Un fallo descubierto en OpenAI, Anthropic y Google permitía a un modelo débil leer el razonamiento oculto de uno más potente
🧠 Modelos & Herramientas IA
Un fallo descubierto en OpenAI, Anthropic y Google permitía a un modelo débil leer el razonamiento oculto de uno más potente
Un fallo descubierto en las API de razonamiento de OpenAI, Anthropic y Google permitía a un modelo más débil leer el razonamiento cifrado de uno más potente, incluidas claves y contraseñas.
OpenAI despliega ChatGPT para adolescentes con controles parentales y un modo estudio activado por defecto
🧠 Modelos & Herramientas IA
OpenAI despliega ChatGPT para adolescentes con controles parentales y un modo estudio activado por defecto
OpenAI despliega una versión de ChatGPT para adolescentes con controles parentales, modo estudio por defecto y restricciones automáticas de contenido, tras un acuerdo con la APA.
OpenAI lanza GPT-5.6-Cyber, un modelo que pasó del 1,5% al 95% de tareas de ciberseguridad completadas al quitarle las restricciones
🧠 Modelos & Herramientas IA
OpenAI lanza GPT-5.6-Cyber, un modelo que pasó del 1,5% al 95% de tareas de ciberseguridad completadas al quitarle las restricciones
OpenAI lanza GPT-5.6-Cyber, un modelo de ciberseguridad que pasó del 1,5% al 95% de tareas completadas al reducir sus restricciones, y ya encontró dos fallos reales en Chrome.