IA

Fable 5.1 de Anthropic reduce el coste de caché un 75% y duplica las puntuaciones agénticas

Susan Hill

Anthropic actualizó Claude el 1 de septiembre con Fable 5.1, reduciendo el coste de los tokens de entrada almacenados en caché de 1,00 $ a 0,25 $ por millón — un descenso del 75% que llega justo cuando la mayoría de los desarrolladores de IA en producción han descubierto que la acumulación de contexto, y no el cómputo bruto, es donde se concentra realmente su presupuesto de infraestructura. En una sesión agentiva en vivo, una sola conversación de Claude puede contener cientos de miles de tokens en caché a medida que el contexto se acumula a lo largo de los turnos. A 0,25 $ por millón, esa acumulación se convierte en una decisión de diseño deliberada, en lugar de un techo de coste que el desarrollador deba sortear.

Los resultados de las pruebas comparativas que acompañan al cambio de precio muestran mejoras de rendimiento que refuerzan el argumento económico. En Terminal-Bench-Science 0.1, que mide el razonamiento científico en varios pasos exigiendo diseño experimental y análisis iterativo, Fable 5.1 obtuvo un 52,6% frente al 24,7% de Fable 5 — más del doble del resultado anterior. AutomationBench mejoró del 17,1% al 31,4%, y Terminal-Bench 4.0, una evaluación más amplia de capacidades agentivas, subió del 42,0% al 55,8%. CursorBench 3.2.0 alcanzó el 73,4%. El patrón en las cuatro evaluaciones es consistente: Fable 5.1 no es incrementalmente mejor en el margen, sino sustancialmente más fiable en las categorías de tareas que definen el valor agentivo.

El efecto combinado reescribe la aritmética de costes de construir con Claude. Una aplicación agentiva que completa una tarea en menos turnos — porque el modelo es más fiable — consume menos ciclos de token en total hasta llegar a un resultado exitoso. Aplique el recorte del 75% en caché a los tokens que sí usa, y la reducción efectiva de coste por tarea en flujos de trabajo agentivos con alta reutilización alcanza el 45% o más. Anthropic no ha publicado una cifra única global para el ahorro combinado, pero los desarrolladores que modelen su propia economía de tokens llegarán a cifras en ese rango para cargas de trabajo intensivas en contexto.

Fable 5.1 está disponible de inmediato a través de la API directa de Anthropic con el identificador de modelo claude-fable-5-1, y a través de Amazon Web Services Bedrock, Google Cloud Platform y Microsoft Azure. Anthropic anunció Enterprise Frontier Safeguards como una capacidad concurrente: retención de datos controlada por el cliente, claves de cifrado gestionadas por el cliente y despliegue dentro del inquilino de infraestructura cloud existente de cada cliente, todo incluido sin coste adicional más allá de los costes subyacentes de la nube.

Junto con el lanzamiento general, Anthropic presentó Mythos 5.1, una variante del mismo modelo subyacente que opera con lo que la compañía describe como salvaguardas más permisivas para organizaciones verificadas. El acceso está restringido a instituciones de investigación en ciberseguridad verificadas y empresas de ciencias de la vida. La compañía citó aplicaciones demostradas que incluyen diseño de fijadores de proteínas y optimización de modelos biológicos con hasta 2,5 veces el rendimiento de inferencia de la versión estándar. El acceso a Mythos 5.1 no es autogestionado: Anthropic revisa las solicitudes individualmente y no ha publicado el tamaño del grupo inscrito.

Los resultados agentivos de Fable 5.1, particularmente en Terminal-Bench-Science, sitúan los resultados publicados de Anthropic por delante de las cifras divulgadas más recientemente por OpenAI en evaluaciones comparables. Las comparaciones entre empresas conllevan una cautela metodológica — los proveedores seleccionan evaluaciones que favorecen a sus modelos, y las pruebas específicas que Anthropic destacó fueron presumiblemente elegidas por sus resultados favorables. Lo que es más difícil de explicar es el patrón interno de duplicación: Fable 5.1 no es el mismo modelo con una reducción de precio añadida. El cambio de rendimiento es lo suficientemente grande como para que la historia del precio y la historia del rendimiento no puedan separarse.

Para los desarrolladores que no usan Claude actualmente, la jugada del precio de caché es la cifra que merece la pena traducir a su propia economía de tokens. Cualquier proveedor de IA que no se acerque a los 0,25 $ por millón de tokens almacenados en caché se enfrentará ahora a preguntas directas de comparación de costes en las conversaciones de ventas empresariales. El precio de caché de Anthropic ya era inferior al de varios competidores antes de esta reducción; la brecha se ha ampliado. Las mejoras de rendimiento son más difíciles de generalizar entre casos de uso, pero en el segmento agentivo y de razonamiento científico, Fable 5.1 establece un nivel de referencia con el que se medirá el próximo gran lanzamiento de cualquier proveedor.

Etiquetas: , , , ,

Debate

Hay 0 comentarios.