Publicado el 31 de julio, DeepSeek-V4-Flash-0731 es una arquitectura de mezcla de expertos (MoE) con 284.000 millones de parámetros totales y 13.000 millones activos por token, ventana de contexto de un millón de tokens, un experto compartido y 256 enrutados de los que se activan seis por token. Las tres primeras capas MoE usan enrutado por hash.
Los resultados en tareas de agentes (frente a la versión anterior): Terminal Bench 2.1, 82,7 frente a 72,1; NL2Repo, 54,2 frente a 38,5; Cybergym, 76,7 frente a 52,7; DeepSWE, 54,4 frente a 12,8.
Los precios: 0,14$ por millón de tokens de entrada cuando la caché falla, 0,0028$ cuando acierta, y 0,28$ por millón de tokens de salida.
Por qué importa: los pesos están publicados bajo licencia MIT y sin restricciones de acceso. Justo cuando Europa exige transparencia sobre los datos de entrenamiento y Estados Unidos debate qué hacer con los modelos abiertos chinos, aparece un modelo de este tamaño que cualquiera puede descargar y ejecutar. El debate político sobre pesos abiertos deja de ser teórico.
Ir al análisis completo →