IA

OpenAI dice que Astra es su modelo más alineado jamás y oculta su razonamiento

Adrian Kessler

Astra opera en código, análisis de seguridad, uso de ordenador y tareas profesionales de varios pasos con una velocidad y precisión que superan al modelo anterior de OpenAI, Sol, y a Fable de Anthropic en los benchmarks estándar de ingeniería de software. La compañía lo describe como el primer modelo que ha creado que supera el nivel «Crítico» de capacidad de ciberseguridad: puede identificar y desarrollar exploits para fallos de seguridad no descubiertos previamente, a una escala y velocidad que ningún equipo humano puede igualar.

El mecanismo detrás de esto es una técnica llamada recurrencia opaca. Los modelos de lenguaje estándar producen su razonamiento como texto legible —la cadena de pensamiento que los investigadores utilizan para auditar decisiones, detectar errores y verificar que un modelo se comporta como se espera—. Astra funciona sin generar ese texto. Puede resolver problemas complejos sin dejar rastro legible del proceso. El director científico de OpenAI, Jakub Pachocki, reconoció el cambio: los modelos más capaces, dijo, pueden «realizar tareas más difíciles usando menos tokens de lenguaje». La monitorización se vuelve más difícil en la misma proporción.

Eso crea un problema estructural que las propias afirmaciones de OpenAI hacen visible. La compañía describe a Astra como su «modelo más alineado» hasta la fecha. El alineamiento —la disciplina de ingeniería que se ocupa de que los sistemas de IA se comporten como pretenden sus diseñadores— ha dependido históricamente de leer lo que el modelo hace paso a paso. Un modelo que razona de forma invisible hace que su propio alineamiento no sea verificable mediante ese método. OpenAI no ha descrito públicamente qué método alternativo utiliza para verificar el comportamiento de Astra antes de su despliegue.

Greg Brockman, presidente de OpenAI, describió a Astra como un «salto generacional» y se le preguntó directamente si representa inteligencia general artificial. Su respuesta: la definición contractual de AGI que regía la asociación de OpenAI con Microsoft ya no aplica. La AGI es ahora, dijo, un «concepto espiritual». Ese encuadre es relevante. El acuerdo de OpenAI con Microsoft incluía cláusulas vinculadas a la AGI —condiciones bajo las cuales cambiarían los términos de la relación—. Describir la AGI como indefinida mantiene esas cláusulas inactivas, independientemente de lo que Astra sea realmente capaz de hacer.

El acceso se lanzó primero a Daybreak, el programa de ciberseguridad verificado de OpenAI —una estructura que la empresa presenta como un despliegue defensivo—. El razonamiento es que las organizaciones que buscan vulnerabilidades en sus propios sistemas obtienen la capacidad antes que quienes buscan vulnerabilidades en los de otros. Esa lógica se mantiene solo mientras los controles de acceso se mantengan. Las capacidades de identificación de zero-day de Astra son, por diseño, precisamente lo que un atacante con recursos querría. Un modelo que razona sin una cadena de pensamiento legible también es más difícil de restringir o auditar después si algo sale mal.

El acceso más amplio se despliega en los niveles de pago —Pro, Plus, Enterprise, Business— y a través de la API en la próxima semana.

Etiquetas: , , , , ,

Debate

Hay 0 comentarios.