IA

ChatGPT marcará sus textos con una marca de agua en la UE: la que OpenAI guardó en 2024

Adrian Kessler
Añádenos en Google

OpenAI pasó mucho tiempo explicando públicamente por qué no pondría una marca de agua en los textos de ChatGPT. Ahora, sin embargo, va a hacerlo. No ha cambiado de opinión por razones tecnológicas. Lo que ha cambiado es que hay una ley, un plazo que cumplir y una multa en juego.

La empresa afirma que los textos que ChatGPT y Codex generen para los usuarios de la Unión Europea llevarán una firma estadística invisible, cuya implantación se extenderá durante las próximas semanas a todos los planes. En el resto del mundo, la misma marca solo está disponible como una opción en la API para desarrolladores, y viene desactivada por defecto. La frontera que ha trazado OpenAI coincide con la de la jurisdicción que puede sancionarla.

Cómo funciona la marca de agua de ChatGPT

El método, llamado textGrain, no añade nada visible al resultado. Cuando varias palabras siguientes encajan más o menos igual de bien en una frase, una clave secreta inclina la elección hacia una de ellas. Un pequeño sesgo no significa nada. Pero, cuando se repite cientos de veces a lo largo de un texto, crea un patrón que un detector con acceso a la clave puede comprobar. Y, como la señal está en las propias palabras, sobrevive a las operaciones de copiar y pegar. OpenAI elaboró el informe técnico con investigadores de la University of Pennsylvania y Yale. Según el documento, el impacto en la calidad no es significativo: en el Artificial Analysis Intelligence Index, el contenido con marca de agua obtuvo 49,76 puntos, frente a los 49,57 del contenido sin ella.

La herramienta que OpenAI ya tenía

Para OpenAI, nada de esto es nuevo. En el verano de 2024, The Wall Street Journal informó de que la empresa ya tenía una marca de agua de texto operativa, con una eficacia del 99,9 % según documentos internos, pero que había decidido no lanzarla. OpenAI respondió que estaba siguiendo «un enfoque deliberado». Sus razones declaradas eran de carácter técnico y social: el método era «trivial de eludir para actores malintencionados» mediante una traducción o una reformulación con otro modelo, y podía estigmatizar la IA como ayuda para escribir entre quienes no tienen el inglés como lengua materna. TechCrunch, al informar sobre el anuncio de esta semana, recuerda una tercera razón de aquella época: el temor a que los usuarios se pasaran a competidores que no utilizaran marcas de agua.

Leído a la luz de esos antecedentes, el nuevo despliegue deja claro cuáles de aquellas preocupaciones ha resuelto realmente OpenAI. El problema de la elusión sigue ahí, según las propias cifras de la empresa. El temor comercial, en cambio, se ha acotado a un único mercado.

Las cifras de OpenAI, no las de sus críticos

En condiciones favorables y con una tasa de falsos positivos del 1 %, el detector identifica aproximadamente el 80 % de los textos con marca de agua de 200 tokens, y cerca del 95 % cuando tienen 400. Si se sustituye el 10 % de las palabras por sinónimos, la tasa de detección cae del 92 % al 66 %. Si se cambia una cuarta parte, baja hasta el 17 %. Las respuestas cortas, las matemáticas y los textos traducidos son muy difíciles de detectar. La propia OpenAI advierte de que un buen rendimiento en condiciones ideales «no garantiza una detección fiable en el uso cotidiano» y de que la ausencia de una marca de agua no demuestra que el texto sea obra de una persona. También señala que la marca no permite identificar al usuario.

Eso convierte textGrain en una señal útil contra quien copia y pega sin más, pero poco eficaz frente a cualquiera que dedique un minuto a editar el texto. En un bloque donde se lee y se escribe en muchas lenguas, la limitación de la detección tras una traducción no es un detalle menor.

Por qué la UE y por qué ahora

El impulso legal procede del artículo 50 de la AI Act, cuyas normas de transparencia entraron en vigor el 2 de agosto. La ley obliga a los proveedores de sistemas generativos a marcar los textos, audios, imágenes y vídeos sintéticos de forma legible por máquinas, y a ofrecer un mecanismo de detección. Los sistemas que ya estaban en el mercado antes de esa fecha, entre ellos ChatGPT, tienen hasta el 2 de diciembre para cumplir. Las infracciones pueden acarrear multas de hasta 15 millones de euros o el 3 % de la facturación anual mundial, la cifra que sea mayor, según un análisis del bufete Cooley.

Hay dos detalles que muestran hasta qué punto el despliegue responde a la obligación, y no a un principio. El primero es el detector. La ley exige un mecanismo de detección; OpenAI ha creado uno y solo se lo ha facilitado a investigadores autorizados y organizaciones especializadas, que tienen que solicitar acceso. La empresa afirma que lo abrirá a más usuarios «cuando creamos que los resultados podrán interpretarse de forma responsable», según informa The Decoder, pero no ha dado un calendario. A día de hoy, un profesor o un editor de Lisboa o Varsovia no puede comprobar un texto sospechoso.

El segundo detalle es el mapa. Anthropic, que empezó a marcar los textos de Claude en agosto, aplica su marca en todo el mundo, independientemente de cómo accedan los usuarios a sus modelos, y recibió críticas de algunos usuarios por ello. OpenAI ha optado por lo contrario: activada por defecto allí donde un regulador puede imponer una multa, opcional para los desarrolladores en el resto del mundo y sin activación predeterminada global en el lanzamiento. Si el antiguo temor a que los usuarios se marcharan a competidores sin marcas de agua hubiera desaparecido, habría pocos motivos para trazar el mapa de esta manera.

Qué viene ahora

OpenAI afirma que publicará textGrain como código abierto y que iguala o supera métodos como SynthID, de Google. Ambas afirmaciones podrán comprobarse cuando el código esté disponible. La pregunta para Bruselas es más concreta: si una marca que se debilita con una edición ligera y que depende de un detector que casi nadie puede utilizar cumple una norma concebida para que otros sistemas puedan reconocer los textos generados por IA.

Después del 2 de diciembre, los únicos usuarios de ChatGPT cuyos textos llevarán por defecto la firma de OpenAI serán aquellos cuyo regulador puede pasarle la factura.

Etiquetas: , , , ,

Añádenos en Google

Debate

Hay 0 comentarios.