·4 min de lectura·Modelos

DeepSeek-V4-Flash-0731: 284.000 millones de parámetros, 1M de contexto y licencia MIT

Una mezcla de expertos con 284B de parámetros totales y solo 13B activos por token, ventana de un millón de tokens y pesos publicados sin restricciones de acceso. Los saltos en tareas de agentes son grandes: 82,7 frente a 72,1 en Terminal Bench 2.1 y 54,4 frente a 12,8 en DeepSWE.

  • Qué pasa: un modelo de frontera con licencia MIT y pesos descargables por cualquiera.
  • El precio: 0,14$ por millón de tokens de entrada y 0,0028$ si la caché acierta.

Publicado el 31 de julio, DeepSeek-V4-Flash-0731 es una arquitectura de mezcla de expertos (MoE) con 284.000 millones de parámetros totales y 13.000 millones activos por token, ventana de contexto de un millón de tokens, un experto compartido y 256 enrutados de los que se activan seis por token. Las tres primeras capas MoE usan enrutado por hash.

Los resultados en tareas de agentes (frente a la versión anterior): Terminal Bench 2.1, 82,7 frente a 72,1; NL2Repo, 54,2 frente a 38,5; Cybergym, 76,7 frente a 52,7; DeepSWE, 54,4 frente a 12,8.

Los precios: 0,14$ por millón de tokens de entrada cuando la caché falla, 0,0028$ cuando acierta, y 0,28$ por millón de tokens de salida.

Por qué importa: los pesos están publicados bajo licencia MIT y sin restricciones de acceso. Justo cuando Europa exige transparencia sobre los datos de entrenamiento y Estados Unidos debate qué hacer con los modelos abiertos chinos, aparece un modelo de este tamaño que cualquiera puede descargar y ejecutar. El debate político sobre pesos abiertos deja de ser teórico.

Ir al análisis completo →

Fuente: MarkTechPost · Hugging Face

Ir a la fuente original →

← Volver a todas las noticias