IA

DeepSeek V4.1 Flash: 552.000 millones de parámetros, 8.000 activos y un 60% más barato en caché

Adrian Kessler

DeepSeek V4.1 Flash funciona con una nueva arquitectura que la compañía denomina Causal Encoder-Decoder. Sus 552.000 millones de parámetros se distribuyen en un codificador de 20 capas y un decodificador de 20 capas, pero solo 8.000 millones se activan en los tokens de entrada y 16.000 millones en los de salida. Esto la hace estructuralmente más ligera que los modelos que activan porciones de parámetros más grandes en cada operación, una decisión de diseño que se traduce directamente en eficiencia de inferencia y ahorro de memoria.

Las ganancias en memoria son concretas. La caché KV de V4.1 Flash ocupa 890 bytes por token, aproximadamente una cuarta parte de la de V4-Flash. El almacenamiento en caché FP4 y Compressed Sparse Attention 2 reducen la huella de la caché persistente a un octavo de la generación anterior. La entrada en caché cuesta ahora $0,003 por millón de tokens en horario de baja demanda, un 60 % menos que en V4-Flash. La entrada no almacenada en caché bajó un 33 % y la salida un 11 %.

En los benchmarks que más siguen los desarrolladores, el modelo mantiene el tipo. DeepSWE v1.1, la prueba autónoma de ingeniería de software, le otorga un 74,2, ligeramente por delante del 74,0 de Opus 5 de Anthropic y por encima del 73,0 de GPT-5.6 Sol. GPQA Diamond obtiene un 90,9. La brecha más llamativa está en Terminal-Bench 3.0: 30,0 frente al 43,3 de Opus 5, una diferencia real en tareas que requieren depuración interactiva prolongada.

La visión está integrada desde el preentrenamiento. Anteriormente, V4 dividía la visión en una variante separada Vision-Exp. V4.1 Flash reemplaza ambas con un único modelo construido en torno a DeepSeek-ViT, un codificador entrenado específicamente y desarrollado conjuntamente con el modelo de lenguaje desde el principio. El nivel multimodal ha desaparecido: toda llamada recibe visión por defecto.

La ventana de contexto es de 1 millón de tokens, con una salida máxima de 384.000, suficiente para el análisis de documentos extensos y flujos de trabajo agénticos prolongados sin necesidad de fragmentación. Los usuarios existentes de la API que utilizan los identificadores antiguos deepseek-v4-flash y deepseek-v4-flash-vision-exp ya están siendo redirigidos a V4.1 Flash. El 14 de septiembre, el tráfico de DeepSeek V4 Pro también se migrará, con los precios de Flash.

DeepSeek describió V4.1 Flash como «el modelo más pequeño de nuestra nueva familia de arquitecturas». Se da a entender que existe un V4.1 Pro más grande basado en el mismo diseño Causal Encoder-Decoder. Si mantiene la trayectoria de eficiencia de Flash, extendería el rendimiento por dólar de esta arquitectura más arriba en la curva de benchmarks, hasta un territorio actualmente ocupado por modelos que cuestan significativamente más por millón de tokens.

El punto arquitectónico importa más allá de la tabla de precios. El crecimiento de la caché KV es una limitación principal para ejecutar modelos grandes con contexto largo, y escala con cada token procesado. El enfoque de V4.1 Flash —menos parámetros activos, caché comprimida— aborda esa limitación directamente. Es una plantilla utilizable para despliegues de contexto largo, no una optimización para casos extremos.

Etiquetas: , , , , ,

Debate

Hay 0 comentarios.