OpenAI, Anthropic, Google, Microsoft y xAI construyen juntas un sistema para medir la gravedad de los jailbreaks de IA
El programa TRAINS, impulsado tras la Orden Ejecutiva 14409, busca sustituir las intervenciones improvisadas del Gobierno de EE. UU. —como la suspensión de Fable 5 o la restricción de GPT-5.6— por un estándar compartido similar al que ya existe para vulnerabilidades informáticas.
Una respuesta común a un problema que ya golpeó a ambas compañías por separado
Cinco de los principales laboratorios de inteligencia artificial del mundo —OpenAI, Anthropic, Google, Microsoft y xAI— participan en TRAINS, un programa de evaluación previa al despliegue que está desarrollando un sistema compartido para puntuar la gravedad de los jailbreaks de modelos de IA, inspirado en el CVSS, el estándar que la industria de la ciberseguridad usa desde hace años para clasificar vulnerabilidades informáticas. El objetivo declarado es contar con un lenguaje común que permita a gobiernos y laboratorios evaluar de forma predecible qué modelos representan un riesgo real antes de que lleguen al público.
La base legal del programa es la Orden Ejecutiva 14409, firmada el 2 de junio de 2026 y titulada "Promoviendo la Innovación y la Seguridad Avanzada en Inteligencia Artificial", que instruyó a la Agencia de Seguridad Nacional, la agencia de ciberseguridad CISA, el Departamento del Tesoro y la Casa Blanca a construir un proceso de evaluación comparativa para los sistemas de IA más avanzados del país. Ni los desarrolladores ni los investigadores externos conocerán con exactitud el umbral de capacidad que activa cada designación de riesgo; lo que sí pueden hacer las compañías es consultar de forma voluntaria a la Agencia de Seguridad Nacional sobre si un modelo en desarrollo alcanza ese umbral.
El precedente que explica la urgencia: dos intervenciones sin reglas claras
El impulso detrás de TRAINS tiene un origen muy concreto: tanto Anthropic como OpenAI sufrieron intervenciones gubernamentales improvisadas en junio y julio de 2026 que no siguieron ningún proceso ni calendario publicado de antemano. Claude Fable 5 y Claude Mythos 5 fueron suspendidos globalmente durante unas tres semanas invocando la autoridad de controles de exportación, mientras que GPT-5.6 quedó restringido a socios verificados por el Gobierno durante doce días antes de su lanzamiento público. Ambos episodios, señalan analistas del sector citados por TechTimes, ocurrieron sin que existiera un umbral, un calendario o un proceso formal que las compañías pudieran anticipar, lo que generó semanas de incertidumbre regulatoria para toda la industria.
Un beneficio desigual entre grandes laboratorios y desarrolladores pequeños
Pareekh Jain, consejero delegado de la consultora Pareekh Consulting, advierte de un efecto colateral del nuevo marco: "Las pruebas son caras y llevan tiempo, así que empresas grandes y bien financiadas como Anthropic, Google y OpenAI pueden permitírselas. Los desarrolladores más pequeños que buscan publicar modelos de pesos abiertos de vanguardia podrían tener dificultades para cumplir los mismos requisitos". El resultado, según esta lectura, es que un sistema pensado para dar previsibilidad a toda la industria podría terminar reforzando, en la práctica, la posición de los laboratorios que ya dominan el mercado, precisamente en un momento en que el debate sobre las restricciones a los modelos abiertos está más vivo que nunca.