El lanzamiento oficial de DeepSeek V4 Flash llegó el 31 de julio de 2026 bajo el nombre de build DeepSeek-V4-Flash-0731, reemplazando a la versión preview de abril. El modelo mantiene la misma arquitectura MoE de 284B parámetros totales (13B activos) y el mismo precio, pero sube 10 puntos en el índice de inteligencia de Artificial Analysis solo por reentrenamiento.
DeepSeek V4 Flash 0731 es la versión oficial (beta pública) del modelo Flash de DeepSeek, publicada el 31 de julio de 2026. Conserva la arquitectura y el precio de la preview, pero fue reentrenado y ahora supera a DeepSeek V4 Pro en los nueve benchmarks de agentes publicados por la compañía, con un puntaje de 50 en el índice de Artificial Analysis.

El build 0731 marca el paso de DeepSeek V4 Flash de preview a lanzamiento oficial.
Comparador de benchmarks: DeepSeek V4 Flash 0731 frente a otros modelos
Usa el selector para comparar el índice de inteligencia de Artificial Analysis, el puntaje en Terminal-Bench 2.1 y el precio por millón de tokens entre DeepSeek V4 Flash 0731 y otros modelos de referencia.
Datos: Artificial Analysis y documentación oficial de DeepSeek (31 jul 2026). Cifras de Terminal-Bench 2.1 marcadas como "reportado por el proveedor" cuando no hay medición independiente.
Qué cambia entre la versión preview y el lanzamiento oficial de DeepSeek V4 Flash
El salto de preview a build oficial no viene de un modelo más grande. DeepSeek confirmó que la arquitectura y el tamaño (284B totales, 13B activos, contexto de 1M tokens) son idénticos a los de abril.
El único cambio es un reentrenamiento posterior (post-training) enfocado en tareas de agente. Ese ajuste, sin tocar el tamaño del modelo, produjo mejoras que en algunos benchmarks superan el 500%.
¿Por qué un modelo "pequeño" supera a su propio modelo Pro?
DeepSeek V4 Pro Preview tiene 1.6 billones de parámetros totales frente a los 284.000 millones de V4 Flash. Aun así, en los nueve benchmarks de agentes publicados por la empresa, la versión oficial de Flash queda por encima de Pro en todos.
Benchmarks de DeepSeek V4 Flash 0731: agentes, terminal y comparación con GLM y Opus
En Terminal-Bench 2.1, DeepSeek V4 Flash 0731 anota 82,7 puntos (cifra del proveedor), frente a 72,1 de V4 Pro Preview y 61,8 de la preview de Flash. Artificial Analysis, en su evaluación independiente con el mismo benchmark, registra 79 puntos.
En DeepSeek, la mejora es más marcada: el puntaje en DeepSWE pasa de 7,3 a 54,4. En Cybergym sube de 38,7 a 76,7 puntos.
- Índice de Inteligencia de Artificial Analysis: 50 puntos, 10 más que la preview de abril (40) y 6 por encima de V4 Pro.
- Frente a GLM-5.2 (max): queda a solo 1 punto de diferencia (51).
- Frente a GPT-5.6 Luna (max): 1 punto por debajo (51), incluso después del recorte de precio de OpenAI del 80% anunciado el mismo día.
- Frente a Claude Opus 4.8: en Terminal-Bench 2.1, Opus 4.8 anota 85 puntos frente a los 82,7 de Flash 0731, una diferencia de apenas 2,3 puntos.
- Frente a Kimi K3 (max): sigue 7 puntos por detrás, que continúa como líder entre los modelos de pesos abiertos.
Artificial Analysis destaca que la reducción de alucinaciones explica buena parte de la mejora: el índice AA-Omniscience pasa de -23 a -16, una mejora de 7 puntos atribuida a menos errores factuales, no a mayor precisión bruta.
Precio de DeepSeek V4 Flash 0731 y contexto de 1 millón de tokens
El precio no cambió respecto a la preview: 0,14 dólares por millón de tokens de entrada y 0,28 por millón de salida, con un descuento del 98% en tokens de caché ($0,0028 por millón).
Ese descuento de caché es clave en flujos de trabajo con agentes, donde se repite gran parte del contexto en cada llamada. Según Artificial Analysis, el costo por tarea de Flash 0731 queda un 60% por debajo del de GPT-5.6 Luna, incluso tras el recorte de precio de OpenAI.
Alcance del lanzamiento
La actualización es exclusiva de la API de deepseek-v4-flash. La app, el sitio web y la API de V4 Pro no cambiaron. DeepSeek indicó que la versión oficial de V4 Pro llegará "próximamente", sin fecha confirmada.
Cómo correr DeepSeek V4 Flash 0731 en hardware local (DGX Spark)
Los pesos abiertos del build 0731 todavía no están publicados en Hugging Face; DeepSeek los anunció para las próximas semanas. Mientras tanto, la comunidad ya prueba el modelo vía API con configuraciones de decodificación especulativa (DSpark) en dos DGX Spark conectados.
Usuarios que ya corrían la preview reportan que el cambio es prácticamente un ajuste de una línea, porque la arquitectura y el tamaño no variaron. El principal ajuste técnico reportado en foros de la comunidad tiene que ver con la aceptación del "draft model" en la decodificación especulativa, que impacta directamente en los tokens por segundo.
- Contexto máximo: 1 millón de tokens
- Arquitectura: MoE, 284B totales / 13B activos
- Requiere: soporte para NVFP4 KV cache en configuraciones de dos GPU/Spark
Preguntas frecuentes sobre el lanzamiento de DeepSeek V4 Flash
¿DeepSeek V4 Flash 0731 es un modelo nuevo?
No. Es la misma arquitectura de 284B parámetros de la preview de abril, sometida a un nuevo proceso de post-entrenamiento enfocado en tareas de agente.
¿Cambió el precio de la API?
No. Se mantiene en 0,14 USD por millón de tokens de entrada y 0,28 USD por millón de salida, con 98% de descuento en tokens cacheados.
¿Cuándo salen los pesos abiertos?
DeepSeek no dio fecha exacta; la comunidad espera la publicación en las próximas semanas, junto con el lanzamiento oficial de V4 Pro previsto para inicios de agosto de 2026.
¿Es mejor que Claude Opus 4.8?
En Terminal-Bench 2.1 queda muy cerca (82,7 frente a 85 puntos) pero a una fracción del precio. No lo supera en todos los benchmarks, pero la relación costo-inteligencia es notablemente más favorable.
Los pesos abiertos y el lanzamiento oficial de V4 Pro son los próximos hitos a seguir en agosto de 2026.