H
HosT.ia

Analisis

Precios de DeepSeek 2026: la subida del 16/8 explicada (y cómo no pagar de más)

DeepSeek subió sus precios hasta un 1100% el 16/8/2026. Te explicamos el desglose exacto de V4 Flash y V4 Pro y las estrategias reales para no pagar de más.

Precios de DeepSeek 2026: la subida del 16/8 explicada (y cómo no pagar de más)
16 de agosto de 2026·9 min de lectura·Por el equipo HosT.ia

DeepSeek subió sus precios hasta un 1100%: qué pasó el 16 de agosto

Si usas DeepSeek para tus agentes autónomos, hoy es un día incómodo. El 16 de agosto DeepSeek actualizó su tarifa de API con una subida histórica de hasta un 1100%. Para quien corre harnesses self-hosted pegados a V4, esto no es un detalle cosmético: es un cambio que redibuja la rentabilidad de las tareas que encadenan decenas de miles de tokens de salida por ejecución.

No subió solo un poquito. Donde antes pagabas $0.14 por millón de tokens de entrada y $0.28 por millón de salida, ahora la familia V4 cobra entre $0.22 y $1.32 en horario pico, y V4 Pro llega a $3.96 en el token de salida. Antes de tocar el deploy, vas a querer saber exactamente qué cambió, por qué, y sobre todo cómo mitigarlo.

Este artículo es el desglose de esa tarifa. Sin humo: precios antes y después, el razonamiento que hay detrás, cómo golpea a un harness tipo el nuevo CLI `dsh` de DeepSeek, y una lista concreta de estrategias para que tu factura no se dispare. Si no pagas de más, al final del post.

  • Subida máxima publicada de hasta 1100% vs los precios anteriores de $0.14/M in y $0.28/M out.
  • Cambio publicado con vigencia el 16 de agosto de 2026.
  • Thinking / chain-of-thought habilitado por defecto en la API de V4 Pro y V4 Flash.

Clave del cambio: el token de salida es el que dispara tu factura

Lo más importante de esta tarifa no es el input: es el output. DeepSeek se diferenciaba tradicionalmente por una salida ridículamente barata, y eso es justo lo que lo hacía perfecto para agentes, donde la inferencia generadora (salidas largas, razonamiento encadenado, edición de ficheros) domina el consumo.

Si miras el input, la subida es moderada: pasas de $0.14 a $0.22 por millón de tokens entrada V4 Flash, un incremento relevante pero asumible. El que mira la línea de output se cae de la silla: de $0.28 a $1.32 por millón en horario punta de Flash. Ahí está la verdadera repreciación.

Compónlo mal y el problema se multiplica: si el 80% de tu gasto es salida, cualquier uso que haga al agente generar más por iteración dispara el coste sin que toques una línea de código. Por eso DeepSeek puso el foco precisamente ahí. Entender esa asimetría es el primer paso para no llevarte una sorpresa a fin de mes.

Desglose exacto: precios nuevos de V4 Flash y V4 Pro

La familia V4 viene con dos endpoints principales según el uso: V4 Flash, el generalista más barato, y V4 Pro, el pesado de mayor coste. La nueva rejilla, además, convive con la distinción entre horario punta y horario valle, y esa separación es tu palanca principal para controlar el gasto.

V4 Flash arranca en $0.22 por millón de tokens de entrada en un cache miss y cuesta $1.32 por millón de salida en horario punta. En horas valle cae a $0.66 por millón de salida, exactamente la mitad. V4 Pro es la gama alta: si el output en punta te cuesta $3.96 por millón, en off-peak se queda en $1.98.

Fíjate en una cifra: V4 Pro llega a costar hasta 4 veces el precio de salida punta de V4 Flash. Esa diferencia es lo que convierte a V4 en un producto rentable para DeepSeek y lo que te obliga a elegir con cuidado qué modelo dispara cada tarea. La decisión ya no es solo de calidad, es de presupuesto.

Para el día a día conviene traducirlo a unidades pequeñas: Flash punta cuesta $0.00132 por millar de tokens de salida, el valle $0.00066 y Pro en punta $0.00396. Cuando tu harness te reporte que una sesión consumió 52.000 tokens de salida, ya puedes hacer la cuenta al vuelo: unos $0.07 en Flash punta, la mitad en valle y más de $0.20 si disparaste Pro. Llevar el precio por token en la cabeza convierte cada log de tu agente en un dato que siempre sabes interpretar.

Tabla comparativa: precios DeepSeek antes y después (16/8/2026)

Para que lo veas de un vistazo, esta es la comparativa del antes y el después. Todas las cifras son por millón de tokens, y las etiquetas "punta" y "valle" siguen la nueva tarifa vigente desde hoy. En el input, el cambio es de $0.14 a $0.22; en el output la horquilla es mucho más amplia según el modelo y la ventana horaria.

ModeloInput (cache miss)Output puntaOutput valle
Antiguo (antes de 16/8)$0.14$0.28$0.28
V4 Flash$0.22$1.32$0.66
V4 Pro$3.96$1.98

Ejemplo real: cuánto cuesta un run autónomo antes y ahora

Traduzcamos la tarifa a algo que reconozcas. Imagina un agente que toca un repo con un par de miles de archivos: por cada loop de razonamiento toma unos 20.000 tokens de entrada y genera unos 8.000 tokens de salida entre pensar, editar ficheros y reportar. Un PR completo con pruebas y correcciones razonables son unas 30 iteraciones.

Esas 30 iteraciones suman unos 240.000 tokens de salida. Antes de la subida, a $0.28 por millón, eran unos $0.07 por run. Con V4 Flash en horario punta, a $1.32, el mismo te lo llevas a unos $0.32. En el tramo valle, a $0.66, se queda en unos $0.16, mucho más cercano al coste antiguo.

Y si el mismo flujo lo lanzas en V4 Pro a $3.96, son unos $0.95 solo en salida por run. Cuando elástica eso a decenas de ejecuciones diarias por equipo, la elección entre modelo y ventana horaria deja de ser un detalle: es la diferencia entre una factura manejable y una que necesita justificación.

  • Ejemplo ilustrativo: 8.000 tokens de salida × 30 iteraciones = 240k tokens por run.
  • Antes ≈ $0.07 · Flash punta ≈ $0.32 · Flash valle ≈ $0.16 · Pro punta ≈ $0.95.
  • Costes calculados con la tarifa vigente el 16/8; aritmética propia sobre los precios publicados.

Por qué DeepSeek subió los precios (y no es capricho)

Tres fuerzas explican un salto de esta magnitud, y todas apuntan al mismo sitio: el razonamiento. Desde que DeepSeek habilitó el thinking y el chain-of-thought por defecto en la API de V4 Pro y V4 Flash, cada llamada quema muchos más tokens, sobre todo de salida. Ese modo reflexivo, que es una joya para agentes, también es caro de servir.

El segundo ángulo es puramente económico: el coste de cómputo del razonamiento encadenado se refleja en la lista de precios, y DeepSeek trasladó parte de la infraestructura al usuario. Ya no es un laboratorio regalado: está amortizando el cómputo desplegado y financiando la iteración siguiente de sus modelos.

El tercero es posicionamiento. Siguen siendo más baratos que los modelos top de gama europea, pero el 1100% marca una intención clara: dejar de ser la oferta infinita a coste simbólico. El mensaje implícito es que los de capa alta cuestan, y que el horario valle existe justo para quien puede esperar.

No busques una sola causa que sea oficial: lo que ves es un reequilibrio de tarifa típico de un proveedor que ya no vive en fase de crecimiento desenfrenado y ha decidido monetizar mejor la inferencia razonada que le piden los agentes.

  • Thinking / chain-of-thought activo por defecto encarece la inferencia por el cómputo extra.
  • El razonamiento encadenado consume más infraestructura y ese gasto se traslada a tarifa.
  • Giro de posicionamiento: de modelo regalado a gama media con horario por demanda.

Impacto real en agentes self-hosted y harnesses como dsh

Aquí es donde la subida muerde de verdad. Un harness autónomo como el nuevo CLI `dsh` de DeepSeek (npx @deepseek-ai/dsh), o cualquiera de la familia Claude Code, Codex, Aider o Cline, no solo habla con la API: lo que hace es encadenar loops de razonamiento. El modelo piensa, escribe el fichero, lanza, falla el test, repiensa, corrige. Cada iteración genera miles de tokens de salida.

Al estar el thinking por defecto, cada loop genera además razonamiento interno que antes no contabilizabas. Con el antiguo $0.28 de salida podías ignorar esos bucles; a $1.32 o $3.96, un solo PR autónomo con una docena de iteraciones te deja un saldo que no pasa desapercibido. La variable que antes era gratis ahora es el mayor factor de tu factura.

Para quien gestiona este tipo de setups, la conclusión es que ya no vale optimizar solo la latencia: ahora cada token es presupuesto explícito. Un equipo que corre builds nocturnos y edición masiva de código con V4 tiene que repensar el marco de coste de cada run y medirlo como una línea real de gasto.

Estrategia 1: explota el horario valle y paga la mitad por salida

La palanca más directa para no pagar de más está en tu propio calendario. DeepSeek distingue punta y valle: en horas de baja demanda, el precio de salida de Flash baja de $1.32 a $0.66 y el de Pro de $3.96 a $1.98. Son la mitad de coste por el token más caro que tu harness genera.

La franja Flash se mueve a la ventana valle para las tareas de experimentación, los rebuilds y las tareas nocturnas. Los CRON jobs, la reindexación y las code reviews programadas encajan perfectamente fuera de horas. Es el cambio de menor esfuerzo contra la subida: no tocas casi nada de código, solo decides cuándo corre lo que no es urgente.

Relee tus colas largas: cualquier tarea que no esté bloqueada por la latencia de un usuario puede pasar a la noche. En casi todos los harness de CLI la diferencia es un flag o un cron, y tu ahorro es inmediato y permanente. Es la política de costes que mejor escala sin cambiar de stack.

Estrategia 2: caché, elegir Flash vs Pro y el batch como escudo

El caché y el cache miss pasan a ser vocabulario de negocio. El input de $0.22 por millón se factura en cada cache miss; recargar system prompts y contextos recurrentes cada vez es pedir que te cobren el doble por lo mismo. Un harness bien configurado reutiliza el contexto a través de caché para no volver a pagar el mismo input en cada loop.

Elegir Flash vs Pro es la otra decisión de coste: gran parte del trabajo diario de un agente no necesita la gama Pro. Los benchmarks lo dejan claro: V4 Flash 0731 supera a V4 Pro en Terminal Bench 2.1 (82.7 frente a 72.1) y también en DeepSWE. Pagar mucho más por una tarea que un modelo barato resuelve igual es desperdicio puro.

Finalmente, el batch: agrupa los trabajos no urgentes en lotes para aprovechar la ventaja de la tarifa valle. Un barrido de varios repos con `dsh`, o un reprocesado de tests con los modelos más baratos, son candidatos perfectos a la cola por lotes y con caché compartido.

La síntesis es simple: recalcular por tarea. El modelo correcto + el momento correcto + el contexto cacheado es el combo que mantiene tu harness competitivo incluso con la tarifa actualizada.

V4 Flash hoy es el modelo barato para agentes de día a día

Si mueves agentes en producción, la fórmula funcional es clara: usa V4 Flash como conductor principal y reserva Pro solo para tareas donde de verdad sume. Los datos de Terminal Bench 2.1 y DeepSWE muestran que Flash rinde igual o mejor en muchos escenarios, así que el "Pro siempre" por defecto ya no se sostiene ante esta diferencia de precio.

Como la tarifa premia el token de salida, un TDD con reintentos sale más caro cuanto peor es tu índice de acierto. El coste real lo define la tasa de iteración, no el precio de un prompt aislado. Medir eso por tarea es el único camino para que el presupuesto de tokens no sea una caja negra.

Cierra el círculo en tu setup con una pasada de saneamiento: vuelve a evaluar cada modelo por tarea, mide las salidas reales por run y cachea los contextos recurrentes. La conclusión es clara: la subida se absorbe mucho mejor si eliges el modelo correcto para cada trabajo, no solo si te resignas a pagar más por lo mismo.

Preguntas frecuentes

¿Cuánto sube el precio de DeepSeek en agosto de 2026?

La subida llega hasta un 1100% y se aplica desde el 16 de agosto. El salto se concentra especialmente en el precio por millón de tokens de salida, el que más usan los agentes.

¿Cuánto cobra ahora DeepSeek V4 Flash?

V4 Flash cobra $0.22 por millón de tokens de entrada (cache miss), $1.32 por millón de salida en horario punta y $0.66 por millón en horario off-peak.

¿Cuál es el precio de DeepSeek V4 Pro?

V4 Pro cobra $3.96 por millón de tokens de salida en horario punta y baja a $1.98 en horario valle. Puede costar hasta 4 veces más que V4 Flash en salida pico.

¿Cuánto pagaba antes por DeepSeek?

Antes del 16 de agosto pagabas $0.14 por millón de tokens de entrada y $0.28 por millón de salida. Es la referencia sobre la que se calcula la subida.

¿Debería cambiar de modelo ahora que subieron los precios?

Muchas tareas funcionan con V4 Flash 0731, que supera a V4 Pro en varios benchmarks. Migrar el trabajo del día a día a Flash y reservar Pro es la forma más barata de absorber el aumento.

¿Qué es el horario off-peak de DeepSeek y cómo me ahorro con él?

Es el tramo de baja demanda donde el precio de salida baja incluso a la mitad: V4 Flash pasa de $1.32 a $0.66 y V4 Pro de $3.96 a $1.98. Mover ahí tus builds nocturnos y colas reduce la factura.

¿Cómo afecta la subida a los harnesses que desarrollo?

Harnesses como el CLI de Claude Code, Codex o el nuevo `dsh` generan muchos tokens de salida por iteración. Con la nueva tarifa cada loop de razonamiento cuesta más, así que conviene huir en caché y poner límites de tokens por tarea.

¿El thinking por defecto encarece DeepSeek?

Sí. Al estar el chain-of-thought habilitado por defecto en V4 Pro y V4 Flash, cada llamada genera más tokens de razonamiento, lo que explica buena parte del mayor coste y de la nueva tarifa.

En HosT.ia montamos tus agentes de producción listos en menos de 30 días, con SLA, dashboard de monitorización y presupuesto de tokens controlado para que una subida de tarifas como esta nunca reviente tu cuenta. Escríbenos para una demo o una estrategia de costes sin compromiso.

Agentes listos para producción en menos de 30 días, con uptime garantizado por SLA y un dashboard de monitorización en vivo. Agenda una llamada estratégica gratuita.

Agenda una llamada