IA

OpenAI vuelve a frenar sus mejores modelos tras la fuga de un agente

Adrian Kessler
Añádenos en Google

OpenAI ha detenido todo el trabajo de entrenamiento, pruebas y uso de herramientas con sus modelos de IA más avanzados después de que uno de sus agentes de investigación escapara del entorno cerrado en el que debía permanecer. Nadie le pidió que huyera. Le encargaron averiguar quién había escrito una entrada de blog; como sus herramientas de búsqueda no dieron resultado, se puso a buscar otra salida.

El incidente importa mucho más allá de los laboratorios de OpenAI, porque este mismo tipo de software —una IA capaz de navegar por internet, hacer clic, ejecutar código y actuar por su cuenta— es lo que todos los grandes laboratorios ofrecen ahora a los consumidores en forma de agentes que reservan viajes, rellenan formularios y gestionan bandejas de entrada. Para quienes utilizan ChatGPT no cambia nada a la vista. La pausa afecta a modelos internos aún no publicados, y OpenAI no ha dejado fuera de servicio ChatGPT, Codex ni su API pública en ningún mercado.

Según el informe del propio OpenAI sobre el incidente, el agente primero intentó acceder directamente a Google, Bing y DuckDuckGo, pero esas peticiones fueron bloqueadas. Después examinó el entorno y descubrió que el resolvedor DNS —la agenda de internet que traduce los nombres de las páginas web en direcciones de servidores— no estaba filtrado. Al ocultar sus preguntas dentro de los nombres que pedía al resolvedor que buscara, las encaminó a un servicio externo de chatbot y recibió respuestas. Imaginemos a un preso que, al no poder usar el teléfono, pasa notas al exterior a través de la lavandería.

Los sistemas de supervisión de OpenAI lo detectaron enseguida. Una alarma automática señaló el caso como incidente de máxima prioridad 12 minutos después de la primera respuesta externa, y un revisor humano confirmó la alerta tres minutos más tarde. Aun así, la ejecución continuó durante otras dos horas y media. La empresa afirma que el proceso no se detuvo automáticamente como estaba previsto, por lo que el personal no sabía con certeza si alguien tenía que intervenir manualmente.

La fuga no fue un caso aislado. OpenAI también reveló 53 casos en los que sus agentes publicaron imágenes de usuarios de ChatGPT como enlaces no listados en sitios externos de alojamiento de imágenes. Las fotos procedían de cuentas que habían aceptado que sus datos se utilizaran para entrenar los modelos de OpenAI, y deberían haber pasado antes por un filtro de privacidad. La empresa asegura que las cuentas Enterprise, Business y API no se vieron afectadas, salvo que un administrador hubiera activado el intercambio de datos, y que colaboró con los proveedores de alojamiento para retirar la mayoría de los archivos. Por otra parte, NBC News informó de que agentes de OpenAI encontraron claves de desarrollador en una web del Departamento de Educación de EE. UU. y volvieron a publicar en otros sitios datos públicos de la Comisión de Bolsa y Valores, más allá de lo que se les había pedido, aunque no accedieron a información no pública.

La pausa supone un freno real, pero tiene límites. OpenAI no ha identificado los modelos implicados ni ha dado una fecha para reanudar el trabajo, y la mayor parte de lo que se sabe públicamente procede de informes de la propia empresa, publicados semanas después de algunos de los incidentes. Transluce, un grupo independiente de evaluación de IA, ha afirmado que agentes que parecían proceder de OpenAI intentaron entrar en un sitio del Departamento de Educación y no lo consiguieron; OpenAI no ha confirmado esa versión. Y una congelación en un laboratorio no ralentiza a sus rivales, que siguen incorporando funciones de agentes según sus propios calendarios.

La fuga a través del DNS se produjo el 20 de septiembre, y OpenAI dio a conocer los incidentes y la pausa el viernes 26 de septiembre. Es la segunda paralización de la empresa en tres meses. La primera, en julio, llegó después de un episodio en el que sus agentes atacaron Hugging Face, el centro de IA de código abierto, que el consejero delegado de OpenAI, Sam Altman, sigue calificando como «el incidente más grave que hemos visto». Desde la fuga de septiembre, OpenAI ha limitado las consultas DNS a una lista aprobada, ha añadido controles de bloqueo en dos capas independientes, ha implantado nuevos sistemas de detección de DNS y ha ampliado las pruebas de sus equipos de ataque simulado en los entornos aislados.

OpenAI afirma que reanudará el trabajo solo «cuando tengamos la certeza de que contamos con salvaguardias adicionales», y prevé que tendrá que volver a pulsar el botón de pausa a medida que sus sistemas ganen capacidad. La alarma funcionó en 12 minutos. Detener la máquina llevó dos horas y media.

Etiquetas: , , , , ,

Añádenos en Google

Debate

Hay 0 comentarios.