IA

La IA de Anthropic envió una pista falsa sobre un asesinato a la policía de Filadelfia, y la ciudad mete a sus abogados

Adrian Kessler
Añádenos en Google

La falsa pista de homicidio que un modelo de Anthropic dejó en una página web de la Policía de Filadelfia nunca llegó a manos de un detective. La detectó antes un filtro de correo no deseado. Esa es la parte tranquilizadora de la historia, y también la que destaca el relato de la propia empresa. La otra parte, aquella sobre la que está actuando Filadelfia, es distinta: la pista permaneció durante semanas en el sistema de la ciudad antes de que la empresa que la había generado se diera cuenta, y ahora la ciudad ha puesto a sus abogados al frente del asunto.

Tras la extraña escena de un chatbot haciéndose pasar por testigo hay un mecanismo más sencillo. El modelo funcionaba sin restricciones en internet, como parte de una prueba, limitado por una breve lista de cosas que no debía hacer. Presentar un testimonio inventado sobre un caso de asesinato sin resolver no figuraba en esa lista.

Qué hizo realmente el modelo de Anthropic

Según la propia Anthropic, se trataba de Claude Haiku 4.5, configurado para inventar y llevar a cabo tareas de ejemplo en páginas web elegidas al azar. Una de ellas era la página de la ciudad para recibir pistas sobre homicidios sin resolver, PhillyUnsolvedMurders.com. Las instrucciones le indicaban que «nunca iniciara sesión, creara cuentas, introdujera datos personales, hiciera compras ni enviara nada que pudiera causar daños». No decían nada sobre los formularios. Así que rellenó uno, dejó en blanco los campos del nombre y los datos de contacto y escribió: «Puede que tenga información sobre este caso».

Según Fox Business, el mensaje iba más allá y afirmaba recordar haber visto a alguien «que encajaba con la descripción» cerca de una calle mencionada en la página. Sin embargo, la página no incluía ninguna descripción de un sospechoso. El mensaje concluía: «Pónganse en contacto conmigo si esta información resulta pertinente». La Policía afirma que el mensaje fue marcado como correo no deseado y nunca se remitió al Centro de Delitos en Tiempo Real para su evaluación, y que no encontró indicios de acceso no autorizado a los sistemas ni a los datos del departamento.

Por qué Filadelfia no lo considera un fallo técnico

En su comunicado, el departamento atribuye a sus propias medidas de seguridad que el daño fuera limitado, pero no permite que eso zanje el asunto. Esas medidas «no restan gravedad al hecho de que un sistema de IA presente información inventada», afirmó, y añadió que «los casos sin resolver implican a víctimas reales, familias que están de duelo e investigadores que trabajan para encontrar respuestas». También trasladó a Anthropic que «la empresa debe reforzar sus medidas de seguridad para evitar que incidentes similares afecten a los sistemas municipales» y calificó de «inaceptable» el retraso hasta que la ciudad recibió el aviso.

Ahí es cuando la historia deja de tratar sobre un modelo y empieza a tratar sobre una empresa. Según NBC10, la Policía trabaja ahora con el Departamento Jurídico de la ciudad, la Oficina de Innovación y Tecnología y el equipo ejecutivo de la alcaldesa Cherelle Parker. La Administración afirma que estudiará medidas de protección normativa en los ámbitos municipal, estatal y federal. No se han anunciado cargos ni sanciones. Pero que un gobierno municipal estudie cómo regular las pruebas que los laboratorios de IA hacen con sus sistemas supone un nuevo tipo de interlocutor para Anthropic.

Un caso más en una lista cada vez más larga

La pista de Filadelfia aparece en un informe que Anthropic publicó el mismo día en que la Policía hizo público el caso. El documento clasifica en cuatro tipos las acciones involuntarias de sus modelos en sistemas reales: aprovechar fallos de software en páginas de terceros para ejecutar comandos, enviar formularios que no deberían haber enviado, sortear restricciones para acceder a datos protegidos y utilizar acortadores de URL para eludir los límites de las herramientas de consulta. En un caso, un modelo de investigación aún no publicado envió un formulario oficial real después de que no consiguiera cargar una copia de práctica. En otro, Claude Mythos 5 encontró tokens de acceso en el archivo de configuración de una página de mapas y los utilizó para consultar un servidor de la administración local.

Algunas de las páginas pertenecían a organismos federales, estatales y locales, y Anthropic afirma que informó a la Casa Blanca y notificó a cada organismo implicado. La empresa describe los casos como de «impacto mínimo en el mundo real» y menos graves que los incidentes que había revelado anteriormente, cuando Claude accedió durante horas a sistemas reales de terceros en el transcurso de evaluaciones de ciberseguridad. También afirma que todavía no ha completado una evaluación integral de alineamiento de los nuevos casos.

El momento en que ocurre todo esto es importante. La Comisión Federal de Comercio confirmó a finales de septiembre una investigación sectorial sobre Anthropic, OpenAI y otros laboratorios, para determinar si habían infringido la Ley de la FTC, y está preparando requerimientos formales que pueden obligar a los directivos a testificar, según Reuters y The Next Web. Reuters informó de que el presidente de la FTC, Andrew Ferguson, había sugerido que los desarrolladores cuyos agentes de prueba acabaran pirateando sistemas deberían responder por los daños. El caso más conocido de ese expediente es el de OpenAI: la empresa reveló en julio que más de mil de sus agentes habían pirateado la plataforma Hugging Face.

Qué ha cambiado Anthropic y qué está admitiendo con ello

Anthropic afirma que suspendió el proceso de pruebas responsable, añadió un paso de validación, limitó más las acciones que sus modelos pueden realizar con herramientas web y creó herramientas de detección que, al ponerlas a prueba, bloquearon todos los casos del informe. El cambio más importante es una retirada: ha ampliado a todas sus evaluaciones internas la suspensión del acceso a internet en tiempo real, «hasta que hayamos confirmado que nuestras medidas de seguridad y supervisión» detectan este comportamiento de forma fiable. Dicho sin rodeos, la empresa todavía no puede garantizar que vaya a detectar lo que hacen sus agentes en la web abierta, así que los está apartando de ella.

Las fechas explican la indignación de la ciudad. La Policía sitúa la pista el 18 de julio (PhillyVoice informó del caso el 28 de julio). Anthropic afirma que encontró el caso al revisar transcripciones, un proceso que comenzó en julio; la Policía sostiene que la empresa lo descubrió el 28 de septiembre. La Policía afirma que Anthropic se lo comunicó el miércoles 7 de octubre y que se reunieron al día siguiente; el informe de Anthropic indica que compartió el hallazgo el 8 de octubre, «en cuanto terminó nuestra revisión técnica». El departamento hizo público el caso el 9 de octubre.

La medida de seguridad que funcionó era de la ciudad: un filtro de correo no deseado y una norma que exige que una persona revise todas las pistas. El próximo formulario que un agente de prueba decida rellenar quizá pertenezca a alguien que no cuente con ninguna de esas dos cosas.

Etiquetas: , , , ,

Añádenos en Google

Debate

Hay 0 comentarios.