IA

Anthropic publica cómo mide la IA que construye IA: Claude lidera el 26% de su propia investigación

Adrian Kessler
Añádenos en Google

Una de cada cuatro tareas de investigación en IA en Anthropic está ahora liderada por Claude. No asignada a Claude como ayudante, ni revisada por Claude después — iniciada a partir de una instrucción de alto nivel y completada de principio a fin, con un humano verificando el resultado cuando termina. Hace nueve meses, esa cifra era inferior al uno por ciento.

Anthropic traza una línea entre dos cosas. Cuando Claude lidera una tarea, maneja la mayor parte del trabajo de forma independiente; un supervisor examina el resultado en lugar de guiar cada paso. Esa es una categoría diferente del noventa por ciento de la I+D total de Anthropic en la que Claude actúa como colaborador — un humano dirige, Claude se encarga de partes específicas. Liderar es la clasificación más exigente. Ahora representa el 26 por ciento de toda la investigación en IA que realiza la empresa, ponderado por el tiempo que los investigadores habrían dedicado a esas tareas.

La escala es concreta. Unos 30.000 agentes de Claude se ejecutan simultáneamente en las plataformas internas de Anthropic, realizando trabajo en entrenamiento de modelos, evaluaciones, investigación en interpretabilidad y análisis de seguridad. En agosto, esos agentes tomaron más de mil millones de decisiones en total. Los sistemas de monitorización en tiempo real de Anthropic bloquearon el 0,002 % de ellas — aproximadamente una de cada 47.000 acciones — antes de su ejecución. Una capa offline luego señaló unas 100.000 transcripciones semanales para su revisión, elevando aproximadamente 50 a un humano.

La seguridad tiene un presupuesto medible dentro de ese sistema. Durante una sola semana de julio, el trabajo dedicado a mantener seguros a los agentes consumió el seis por ciento de toda la computación de investigación y desarrollo en IA, y el doce por ciento de la computación que la propia I+D impulsada por IA estaba utilizando. Anthropic afirma que clasificó de forma conservadora, excluyendo los clasificadores de seguridad dedicados del cómputo, lo que sugiere que la proporción real es aún mayor.

Un problema epistemológico se sitúa en el centro de todo esto. La contribución de Claude a la investigación de Anthropic se evalúa en parte por el propio Claude. Un modelo de Claude evalúa el trabajo de Claude; las cifras de supervisión cubren solo una plataforma interna; y la clasificación de la computación se basó en que los modelos de Claude muestrearan y etiquetaran sus propias ejecuciones. Ningún tercero independiente ha auditado la metodología. Los tres números que Anthropic publicó son precisos, pero son una precisión autoinformada — que es algo diferente a una precisión verificada.

Anthropic afirma que comenzará a integrar evaluadores externos en el proceso. Aún no han aparecido nombres, fechas de inicio ni divulgaciones comparables de otros laboratorios de IA. La cifra del 26 %, al ritmo que ha avanzado, es una instantánea más que un techo.

Etiquetas: , , , , ,

Añádenos en Google

Debate

Hay 0 comentarios.