H
HosT.ia

Comparativas

V4 Flash vs V4 Pro: el benchmark que nadie esperaba (82.7 vs 72.1)

El V4 Flash 0731 supera al V4 Pro en 9 benchmarks publicados y cuesta una fracción. Precios, tabla comparativa y qué implica para tus agentes.

V4 Flash vs V4 Pro: el benchmark que nadie esperaba (82.7 vs 72.1)
16 de agosto de 2026·9 min de lectura·Por el equipo HosT.ia

La sorpresa que rompe la lógica de rangos de modelos

Durante años asumiste que dentro de una familia de modelos la jerarquía era rígida: el "Pro" siempre queda por encima del "Flash", igual que el modelo insignia supera al ligero. DeepSeek acaba de romper ese supuesto con la revisión V4 Flash 0731. Según los benchmarks publicados por la propia compañía, el V4 Flash 0731 supera al V4 Pro en 9 de los benchmarks publicados. Nadie esperaba este resultado.

No es un punto de diferencia dentro del margen de error. En Terminal Bench 2.1, la referencia para trabajo de terminal y agentes de coding, el V4 Flash marca 82.7 y el V4 Pro queda en 72.1. Son más de diez puntos a favor del modelo supuestamente barato. DeepSWE tampoco es casualidad. Si tu pipeline ya usa la API de DeepSeek, la conclusión es incómoda: puedes estar pagando una prima por el nombre "Pro" y obtener peores números.

La conclusión incómoda que tienes que aceptar

Traduce lo que significan estos números para tu proyecto. Pagas un extra por la versión Pro para ganar rendimiento, pero en el caso de DeepSeek V4 lo publicado muestra lo contrario para el trabajo de agentes. El modelo más barato rinde mejor en la tarea que te importa. No es una opinión de blog, es lo que DeepSeek publica sobre su propia familia.

Nada de esto convierte al V4 Pro en un mal modelo. Solo indica que para las cargas que mide Terminal Bench 2.1 y DeepSWE, el V4 Flash es la mejor opción y el precio acompaña. No tienes que elegir entre rentabilidad y calidad, aquí van juntas. Antes de tocar producción conviene entender el porqué y verificar el caso con tus propios benchmarks.

Por qué el modelo "barato" gana en agentes de coding

La primera pista está en el sufijo 0731. No es que el concepto V4 Flash sea superior al Pro: es la revisión concreta de la build la que lidera los 9 benchmarks publicados. Esa build parece optimizada para el trabajo de agente: operar en terminal, editar archivos, leer salidas largas, detectar errores, corregir y repetir. Eso es justo lo que mide Terminal Bench 2.1 y lo que exige DeepSWE sobre un repositorio real.

El segundo detalle técnico es clave. En los modelos DeepSeek V4 el thinking y el chain-of-thought están habilitados por defecto en la API, tanto en Pro como en Flash. No comparas un Flash sin razonamiento contra un Pro con razonamiento, los dos razonan. La diferencia se explica por una build Flash mejor ajustada para el uso de agente, no por un Pro inferior en general.

  • V4 Flash 0731 supera a V4 Pro en 9 benchmarks publicados, Terminal Bench 2.1 incluido.
  • En Terminal Bench 2.1 el Flash marca 82.7 y el Pro 72.1.
  • DeepSWE también se decanta a favor del Flash.
  • Thinking y chain-of-thought habilitados por defecto en ambos.

Precios en vivo: el V4 Pro cuesta hasta 14 veces más

El giro es que no tienes que pagar la prima. La política de precios de DeepSeek V4 vigente desde el 16 de agosto de 2026 sitúa al V4 Flash en 0.22 por millón de tokens de entrada en cache miss, 1.32 por la salida en horario peak y 0.66 en off-peak. El V4 Pro se vende a 3.96 por la salida en peak y 1.98 en off-peak. En la salida en peak la factura se multiplica hasta por unas 14 veces.

Ese dato de hasta 14 veces es lo que debes interiorizar. En una aplicación de agentes la salida domina la factura y con el chain-of-thought activado cada tarea consume más tokens de salida. Cuando un modelo rinde mejor y cobra una fracción, el coste por tarea resuelta baja. Es la combinación que cualquiera pide: más rendimiento y menos gasto.

  • V4 Flash desde el 16/8/2026: entrada $0.22, salida peak $1.32, off-peak $0.66.
  • V4 Pro: salida peak $3.96, off-peak $1.98 (hasta 14 veces más que el Flash).
  • Input en cache miss y output peak son los puntos que arrastran la factura.

Tabla comparativa completa: benchmarks y precios

Aquí tienes el marco de la decisión con los benchmarks publicados por DeepSeek y la tarifa vigente desde el 16/8/2026. No es solo precio: primero rendimiento en la tarea y luego coste por token.

MétricaV4 FlashV4 Pro
Benchmarks publicados donde vence 07319
Terminal Bench 2.182.772.1
DeepSWEFavorable al FlashPor detrás del Flash
Thinking / chain-of-thoughtPor defectoPor defecto
Entrada cache miss$0.22 / M$0.22 / M
Salida peak$1.32 / M$3.96 / M
Salida off-peak$0.66 / M$1.98 / M

Cómo un mejor benchmark ahorra dinero en agentes

El coste de un agente no es solo la llamada que tiene éxito. Un modelo que falla obliga a reintentos, a repetir el prompt y a volcar más contexto en el siguiente intento. Cuando el Flash gana por más de diez puntos en Terminal Bench 2.1 reduces ese gasto oculto: menos fallos, menos reintentos y menos tokens gastados.

En arquitecturas de varias fases, donde primero se planifica y luego se ejecuta y se verifica, el coste de errar se agrava. Un fallo en la fase de planificación obliga a repetir etapas completas. Si tu stack usa métricas tipo Terminal Bench para elegir el motor de ejecución, este resultado debería fijar el Flash por defecto para las fases de ejecución y refactor.

Además tienes la ventana off-peak. En el Flash el token de salida baja a 0.66 fuera de pico. Si difieres la generación masiva a la noche, recortas aún más el coste por tarea.

  • Menos fallos implican menos reintentos y menos tokens quemados.
  • El 82.7 frente a 72.1 reduce las rutas muertas del agente.
  • Off-peak a $0.66 la salida para lotes nocturnos.

¿Cuál elegir según tu caso de uso? La regla práctica

No hay respuesta única, deja que los datos la den. Para el flujo habitual de un agente de coding, editar muchos archivos, correr tests, leer errores y refactorizar de forma iterativa, apunta por defecto al V4 Flash 0731. Es el que domina los benchmarks y cuesta menos. En tu runner o en el repo, "Flash por defecto" es hoy una regla razonable.

¿Y dónde va el V4 Pro? En tareas donde importa la capacidad bruta del modelo grande, como cadenas de pensamiento muy largas con contexto enorme o generación con muy alta calidad. La jugada más barata es el mix: Flash para la mayoría de tareas iterativas y Pro para los pasos puntuales que lo justifiquen.

  • Tareas de agente iterativas: V4 Flash 0731 por defecto.
  • Razonamiento largo o contexto enorme: valora V4 Pro.
  • Puedes combinar ambos según la fase de la tarea.

Un subidón de precios al que hay que reaccionar hoy

Ahora un dato de costes que conviene revisar con urgencia. Los precios de DeepSeek V4 subieron hasta un 1100% frente a los anteriores, que eran 0.14 por millón de entrada y 0.28 por millón de salida. Quien no ha tocado su stack de agentes en varias semanas está asumiendo una subida que no ha planificado.

Aquí el comparativo Flash frente a Pro deja de ser teoría y se vuelve urgente: con las tarifas nuevas, mover el motor de ejecución del Pro al Flash es el ajuste más grande de la factura que puedes hacer con una sola configuración. El mercado cambió de precio y tu presupuesto lo nota.

FAQ de DeepSeek V4 Flash vs Pro en 2026

Antes de tocar la configuración o hablar con tu equipo, estas son las preguntas más repetidas por otros desarrolladores, con los datos publicados por DeepSeek y la tarifa vigente.

  • La revisión 0731 está por delante del Pro en los benchmarks oficiales.
  • Para tareas de agente iterativas, arranca con el Flash.
  • Compara siempre con tus repositorios reales y tu propio harness.

Conclusión: deja que la evidencia decida por ti

La conclusión es breve. El V4 Flash 0731 supera al V4 Pro en 9 benchmarks publicados por DeepSeek, con ventaja en Terminal Bench 2.1 (82.7 frente a 72.1) y con DeepSWE a favor, y cuesta hasta 14 veces menos en la salida en peak. Cuando el modelo más barato también mide mejor, no hay debate técnico complicado.

Ahora lo importante es no transferir esta conclusión a tu programa sin medir. Una suite de tareas reales en tu harness te da una idea exacta de la mejora y del impacto en la factura con las tarifas del 16/8/2026. Con DeepSeek Harness (npx @deepseek-ai/dsh web) puedes aislar y repetir mediciones en minutos. Si no quieres perder eso, la evidencia pública es un buen punto de partida: Flash para agentes de coding.

Preguntas frecuentes

¿De verdad el V4 Flash supera al V4 Pro en benchmarks?

Sí. Según los benchmarks oficiales publicados por DeepSeek, la revisión V4 Flash 0731 supera al V4 Pro en 9 benchmarks publicados, incluido Terminal Bench 2.1 con 82.7 frente a 72.1, y DeepSWE también es a favor del Flash.

¿Cuál es el precio del DeepSeek V4 Flash por millón de tokens?

Desde el 16 de agosto de 2026, el V4 Flash cuesta $0.22 por M de entrada en cache miss, $1.32 por M de salida en peak y $0.66 en off-peak.

¿Cuánto cuesta el V4 Pro frente al Flash?

El V4 Pro cobra $3.96 por M de salida en peak y $1.98 en off-peak. En la salida en peak puede llegar a ser hasta 14 veces más cara que el Flash, que además rinde mejor en los benchmarks de agentes.

¿Qué mide Terminal Bench 2.1 y por qué importa?

Es un benchmark de tareas de terminal y coding para agentes. DeepSeek publica 82.7 para el V4 Flash y 72.1 para el V4 Pro, una ventaja de más de diez puntos en un trabajo muy habitual.

¿DeepSeek V4 tiene chain-of-thought activado por defecto?

Sí. Tanto el V4 Pro como el V4 Flash tienen activado por defecto el thinking o chain-of-thought en la API. El benchmark compara los dos modelos con razonamiento activado.

¿Vale la pena elegir V4 Flash para mis coding agents?

Para tareas de coding iterativas (editar, tests, terminal, refactor) sí. El Flash rinde mejor y cuesta hasta 14 veces menos en salida peak, así que el coste por tarea resuelta baja.

¿Queda obsoleto el V4 Pro?

No. Es un modelo de mayor capacidad general. La lección es que para tareas de agente de coding el Flash está optimizado y rinde más por menos. La decisión se toma con tu propio benchmark.

¿Subieron los precios de DeepSeek V4?

Sí, subieron hasta un 1100% frente a los anteriores, que eran $0.14 por M de entrada y $0.28 por M de salida. La nueva tarifa está vigente desde el 16 de agosto de 2026.

¿Cómo mido yo qué modelo me conviene?

Crea una suite de tareas reales y ejecutala con tu harness, por ejemplo DeepSeek Harness que es de licencia MIT. Compara la tasa de éxito y el coste por tarea resuelta.

No te hipoteques con una prima por el nombre. En HosT.ia preparamos agentes listos para producción en menos de 30 días, con SLA y un dashboard de monitoreo para ver en vivo el coste real de cada modelo en tus tareas, V4 Flash frente a V4 Pro con las tarifas de 2026. Un miembro de nuestro equipo levanta el benchmark de tu caso y deja la configuración que mejor rendimiento por euro. Agenda una demo o una estrategia call en hostia.solutions y disfruta del rendimiento del Flash sin pagar el premium del Pro.

Agentes listos para producción en menos de 30 días, con uptime garantizado por SLA y un dashboard de monitorización en vivo. Agenda una llamada estratégica gratuita.

Agenda una llamada