IA

Claude Opus 5.5 es un 40% más barato mientras Anthropic pide frenar el ritmo de la IA

Susan Hill
Añádenos en Google

Claude Opus 5.5 hace algo que los modelos anteriores de Anthropic no hacían: cuesta menos y funciona más rápido, al tiempo que iguala o supera a un sistema más grande y caro. El modelo aborda la programación agéntica, el uso de ordenadores, la lectura de gráficos y el razonamiento multidisciplinar a niveles que, según los propios datos de Anthropic, superan en varias métricas a los de Claude Fable 5.1, hasta ahora el modelo más capaz de la compañía. Para las personas y los desarrolladores que consideraban útil Opus 5, pero caro, la diferencia entre lo que puede hacer el modelo y lo que cuesta ha cambiado de forma significativa.

La diferencia de precio es concreta. Opus 5.5 cobra 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida; Opus 5 costaba 5 y 25 dólares, respectivamente. Las lecturas en caché bajan de 0,50 a 0,20 dólares por millón de tokens. Anthropic afirma que las cargas de trabajo habituales resultan en conjunto alrededor de un 40% más baratas. La velocidad sigue la misma tendencia: el modelo estándar genera texto más de un 30% más rápido que Opus 5. Una opción independiente de modo rápido, con un precio de 8 dólares por millón de tokens de entrada y 40 dólares por millón de tokens de salida, alcanza hasta 2,5 veces la velocidad del Opus 5 estándar, un ajuste útil para aplicaciones sensibles a la latencia.

Las cifras de rendimiento publicadas por Anthropic sitúan a Opus 5.5 por delante de Fable 5.1, Opus 5 y GPT-6 Astra en cuatro de las seis pruebas comparativas. En Terminal-Bench 4.0, que evalúa la ejecución de código en un entorno de terminal en directo, Opus 5.5 obtiene un 66,4% frente al 55,8% de Fable 5.1. En Humanity’s Last Exam, una prueba que abarca conocimientos académicos y profesionales de distintas disciplinas, el resultado es del 67,7% frente al 65,6%. OSWorld 2.0, que mide el manejo de interfaces informáticas, arroja un 81,8% frente al 80,7%. Una prueba de Deloitte concluyó que Opus 5.5, en su configuración de esfuerzo más baja, detectó el 72% de los errores de programación conocidos durante la revisión, frente al 56% de Opus 5 con un esfuerzo alto. Estas cifras proceden de Anthropic y de sus socios seleccionados; los márgenes de error declarados oscilan entre ±1,6 y ±5 puntos porcentuales, y en el lanzamiento no se ha publicado ninguna verificación independiente por parte de terceros.

Dos áreas rompen el patrón. En AutomationBench, GPT-6 Astra obtiene un 41,4% frente al 40,0% de Opus 5.5. En Terminal-Bench-Science, la diferencia es mayor: Astra alcanza el 64,6%, mientras que Opus 5.5 se queda en el 58,7%. Ambas diferencias entran dentro de los márgenes de error declarados —podrían ser ruido estadístico—, pero también podrían no serlo. Anthropic incluye estas filas en su propia tabla publicada, más de lo que hacen la mayoría de las empresas de IA en el lanzamiento. Las cifras aún necesitan un escrutinio independiente antes de que puedan considerarse concluyentes.

En materia de seguridad, Anthropic afirma que Opus 5.5 fue evaluado antes de su lanzamiento por equipos externos, entre ellos METR. En la propia auditoría interna de comportamiento de la compañía, con cerca de 2.000 escenarios diseñados para comprobar si el modelo intenta sortear las restricciones que se le imponen, se describe a Opus 5.5 como un 85% menos propenso que Opus 5 a intentar esa elusión. Los modelos más potentes tienden a ser más capaces de encontrar vías alternativas, lo que hace significativa la mejora si se confirma. La experiencia de despliegue será la verdadera prueba.

Lo que hace inusual este lanzamiento es el momento en que se produce. A principios de este mes, el consejero delegado de Anthropic, Dario Amodei, publicó un ensayo en el que escribió que se había convencido de que abordar plenamente los riesgos de la IA exige «moderar el ritmo de avance de las capacidades para que la prevención de riesgos tenga tiempo de seguir el ritmo». Sam Altman, de OpenAI, y Elon Musk expresaron su acuerdo con la preocupación general. Jensen Huang, de Nvidia, afirmó que la ciencia subyacente no lo respalda. Y entonces Anthropic lanzó un modelo más rápido, más barato y más capaz que su predecesor. Una interpretación es que un modelo con mejores evaluaciones de seguridad y un acceso más amplio es precisamente lo que Amodei tenía en mente. Otra es que el ensayo señalaba como preocupación el avance de las capacidades, y las capacidades avanzaron. Ambas interpretaciones encajan en el mismo conjunto de hechos, y los benchmarks de Anthropic por sí solos no pueden resolver cuál es la correcta.

Claude Opus 5.5 está disponible desde el 22 de septiembre de 2026 bajo el ID de modelo de API claude-opus-5-5. Funciona dentro de Claude en los planes Pro, Max, Team y Enterprise, y es accesible a través de AWS, Google Cloud y Microsoft Azure. Anthropic está elevando los límites de uso en los niveles de suscripción de cinco horas. Está previsto que Sonnet 5.5 y Haiku 5.5, los miembros restantes de la familia 5.5, lleguen en las próximas semanas, sin que se haya anunciado para ninguno de ellos precio ni fecha concreta de lanzamiento.

Etiquetas: , , , , ,

Añádenos en Google

Debate

Hay 0 comentarios.