Comparativas
Kimi K3 vs DeepSeek V4: el nuevo top chino es brutal... y caro
Kimi K3 vs DeepSeek V4: precios reales (V4 Flash desde $0.22/M), benchmarks como Terminal Bench 2.1 y para quién conviene cada modelo en agencias y startups.
Dos formas de ganar desde China: el panorama detrás del duelo
Si llevas unos años en esto, el término "modelo chino" pasó de ser una anécdota a describir la mitad de la economía de la inferencia. Lo que se ve en el frente Kimi K3 vs DeepSeek V4 no es una novedad aislada: es la culminación de dos estrategias que llevan cuadrando desde 2024: destilar para bajar costes y abrir el código para mover la adopción.
La destilación es la clave de todo. Un modelo grande y caro enseña a un modelo pequeño y barato a comportarse casi igual, y el resultado se licencia abierto con los pesos publicados. Ese truco permitió a DeepSeek lanzar modelos que corren en hardware modesto y cobrar una fracción de lo que piden los líderes anglófonos. El efecto colateral es que el punto de entrada para una startup baja muchísimo: ya no necesitas el presupuesto de una big tech para tener razonamiento de nivel frontier.
En ese escenario, Kimi K3 y DeepSeek V4 ocupan dos nichos distintos del mismo tablero. Uno es el flagship de su casa: modelo grande, potente, presumiblemente más caro. El otro es la apuesta de calidad-precio convertida en producto: DeepSeek V4, con una versión Flash para ser barata y rápida y una Pro para el trabajo pesado. La comparación real, con los datos sobre la mesa, no es mejor vs peor, sino dónde te duele el presupuesto y qué tarea necesitas resolver.
Positioning realista: DeepSeek apuesta por calidad-precio, Kimi por el flagship
Olvídate del titular fácil de "quién gana". El posicionamiento es lo que decide tu elección. DeepSeek ha hecho de su bandera precisamente el coste por token: modelos abiertos, pesos publicados y una vía Flash pensada para el volumen real de producción. La nueva DeepSeek V4 refuerza esa tesis: mantiene el enfoque abierto y, además, ajusta la horquilla de precios con un V4 Flash diseñada para ser el caballo de tiro diario de una API.
Kimi K3, en cambio, se plantea como el modelo grande de referencia de su casa: esa pieza que priorizas cuando necesitas la máxima capacidad aunque el impacto en la factura pase a un segundo plano. La lógica del flagship caro tiene sentido si tu caso de uso justifica esa capacidad extra: pipelines de razonamiento largo, agentes que encadenan decenas de pasos, o cotas de exactitud donde fallar una vez sale caro.
Aquí soy honesto: los números concretos de Kimi K3, como parámetros, precio exacto por millón de tokens o su lista de benchmarks, no están verificados en nuestros datos de campo. El brief del que trabajo permite fijar el posicionamiento, flagship caro, pero no los cifrados exactos. Cuando compres, tira del pricing oficial de ese día; la cadencia de cambios de precio en este mercado es de semanas, no de trimestres. Lo que no necesitas es que te digan cuál es mejor: el encaje está claro, una apuesta de calidad-precio contra una de capacidad máxima.
Precios reales verificados: cuánto cuesta en realidad DeepSeek V4
Aquí, datos de campo actualizados a 16/8/2026 y comprobables en nuestro proceso de investigación: DeepSeek V4 Flash parte de 0,22 USD por millón de tokens de input en cache miss, y 1,32 USD por millón de output en ventana peak. En horas valle baja a 0,66 USD de output. La V4 Pro llega hasta 3,96 USD por millón de output en peak y 1,98 USD fuera de las horas punta, es decir, hasta 14 veces el precio de la Flash.
El dato que debería encender una alarma si lo comparas con tu factura actual es la subida general del precio: DeepSeek venía de unos 0,14 USD de input y 0,28 USD de output, y la nueva V4 sube el precio hasta un 1100%. Sí, has leído bien: el modelo barato de la casa es hasta once veces más caro de lo que se cobraba el ciclo anterior. Eso es lo que justifica el "y caro" del título: la calidad-precio sigue siendo atractiva frente a la competencia, pero el punto de entrada global ha subido.
Traducción práctica: un caso de autocompletado o de extracción que antes te costaba céntimos por cada mil requests tendrá ahora un presupuesto superior, y es el momento de revisar si todas tus llamadas necesitan el modelo grande o si la Flash te sobra. La separación de caminos entre Flash y Pro dentro de la propia DeepSeek es tu primera y mejor palanca de control de costes.
| Concepto | V4 Flash | V4 Pro |
|---|---|---|
| Input por M (cache miss) | 0,22 $ | n/d (ver pricing oficial) |
| Output $/M peak | 1,32 $ | 3,96 $ |
| Output $/M off-peak | 0,66 $ | 1,98 $ |
| Multiplicador vs Flash | base | hasta 14x |
| Precio anterior DeepSeek | 0,14 $ in / 0,28 $ out | — |
| Subida vs ciclo anterior | hasta 1100% | hasta 1100% |
Benchmarks reales disponibles: Flash gana... y te va a sorprender
Este es el punto donde la historia se pone interesante y resume el posicionamiento de la casa. Según los datos públicos recogidos, V4 Flash 0731 supera a V4 Pro en nueve benchmarks publicados. En los test de referencia que encuentras en la documentación, la versión económica gana a la versión tope. No es una opinión mía: es lo que reflejan los números.
Concretamente, en Terminal Bench 2.1, un benchmark de uso de terminal y tareas de agente, Flash marca 82,7 frente a los 72,1 de Pro. También en DeepSWE, un benchmark orientado a ingeniería de software real, sale reflejada a favor de Flash. Es el ejemplo perfecto de que, para tareas de agente y de código, la versión pequeña de la familia puede rendir mejor que la grande, sobre todo cuando el pipeline prioriza velocidad y coste.
Ojo: esto no significa que Pro no sirva para nada. Significa que la métrica "más grande, más capaz" se ha roto en esta familia, y que para la mayoría de tus tareas de producción empezar por Flash es una decisión con datos a favor. Empieza siempre corriendo tu propio eval con tus datos; el benchmark del proveedor es contextual y puede no reflejar tu tarea exacta.
Ecosistema: el harness de DeepSeek y la apuesta plugin
DeepSeek sabe que hoy no basta con vender un modelo: hay que vender el flujo de trabajo. Por eso presentó el 13/8/2026 DeepSeek Harness v0.1, un CLI llamado dsh que se ejecuta con npx @deepseek-ai/dsh web. El motor es Node.js y la filosofía declarada es "everything is a plugin": modelos, herramientas, skills, sesiones, sandboxes, filesystems, bucles, orquestación y UI son plugins intercambiables.
El harness se apoya en el meta-framework Cordis, que gestiona el load y unload de dependencias y permite que los plugins colaboren vía services y events, y está publicado con licencia MIT en estado de Developer Preview. Es decir: es un proyecto en desarrollo, técnicamente abierto, que apunta claramente a competir con plantillas que ya conoces: Claude Code, OpenAI Codex y la familia más amplia que mencionan las publicaciones del sector, con Aider, Cline, Goose, OpenCode, OpenHands y Pi.
Para una agencia, esto significa que elegir DeepSeek V4 no es solo elegir un token, sino alinearse con una hoja de ruta de tooling pluggable que busca integrar la orquestación de agentes en el mismo paquete de la empresa. Si vives en el terminal y quieres probar orquestación de agentes en open source, dsh es un candidato para añadir a la caja de herramientas; recuerda solo el estado de Developer Preview antes de llevarlo a producción sin red de seguridad.
Thinking activado por defecto: qué cambia en la API
Un detalle que no deberías pasar por alto al elegir: en la API de DeepSeek V4, el modo thinking o chain-of-thought viene activado por defecto tanto en V4 Pro como en V4 Flash. Traducción: no tienes que configurar nada para que el modelo reflexione antes de responder, y eso cambia tanto la latencia como la factura si vienes de modelos donde el CoT es un interruptor opcional.
Lo positivo es la calidad de respuesta en tareas de razonamiento; lo que toca gestionar es que el output de razonamiento, aunque no lo utilices, también cuenta en el total de tokens consumidos. Para integrarlo en tus pipelines, mide el gasto real por request, sumando input, output y razonamiento, en lugar de mirar solo la tarifa por token. Los precios ya los tienes arriba; multiplica por la realidad de tu tráfico.
Aquí es donde la decisión entre Flash y Pro se concreta en tu stack: si tus llamadas son mayoritariamente de baja latencia o tareas simples, un thinking costoso en el modelo grande se amortiza peor. Diseña tu router para que solo un porcentaje reducido de tus consultas, alrededor del 10-15%, vaya al modelo que de verdad necesita razonamiento profundo, y deja la Flash para el resto.
Para quién conviene cada uno: la vista de agencia y de build
Empecemos por la startup lean: tu volumen es alto, tu margen bajo y necesitas que cada petición cuente. Tu modelo es DeepSeek V4 Flash de cabeza. Con el coste de 0,22 $ de input y 1,32 $ de output en el peor caso, consigues una inferencia aguantable para un producto tier, y los benchmarks de agente, como los 82,7 en Terminal Bench 2.1, te dan confianza en tareas de tooling. Además ahorras hardware gracias al open source.
En la agencia que vende agentes a clientes con SLA y monitorización, la historia cambia: quieres separar en dos capas. Flash para el volumen, Pro para las tareas que exigen más profundidad, y, clave de posicionamiento, puedes incluso ofrecer tres tier de precio a tus clientes: uno económico con Flash, uno premium con Pro y uno custom. Esa es la jugada que convierte un duelo de modelos en margen facturable.
Y en la punta Kimi K3: si necesitas un flagship para tareas donde la capacidad máxima importa más que el coste, prueba una de sus APIs antes de prometer a un cliente funciones atadas a un único proveedor. Ten en cuenta la advertencia: sin datos de precio verificados en nuestro brief, monta un benchmark tuyo con tu workload y deja que los números, no el hype, decidan. Para una startup temprana, donde cada margen cuenta, el consejo es claro: empieza por DeepSeek Flash y reserva la prueba del flagship para cuando el producto lo exija.
El benchmark de verdad: cómo validar una decisión de arquitectura
El mayor error en una comparativa así es decidir por titulares de marketing en vez de un benchmark propio. Ya tienes los precios sobre la mesa; ahora monta una prueba reproducible con tus tareas más comunes: un prompt de código, uno de razonamiento largo y uno de generación de salida larga. Mide tres ejes: precisión con el criterio que tú defines, latencia y coste real por ejecución.
Cuando tengas los tres números, aplica el cálculo de ROI proyectado: con el volumen diario estimado de producción, halla el coste mensual de cada candidato, Flash frente a Pro frente a la opción de flagship si consigues precio. No basta con ser mejor en el benchmark del vendor; tienes que serlo en tus propios términos. Ese es el oficio que no te da un paper: es lo que paga el cliente.
Yo recomiendo documentar la evidencia en un doc interno con tabla de resultados y capturas, porque cuando el cliente te pregunte por qué DeepSeek y no Kimi, la respuesta sea una tabla con datos propios y reproducibles, no una nota de tendencia. Y recuerda que este mercado cambia las cifras cada pocas semanas: vuelve a validar con cierta regularidad. El modelo de hoy no es el de ayer.
Tabla de posición definitiva: Kimi K3 vs DeepSeek V4
Cierro con la tabla que resume la comparativa para que la guardes como referencia rápida para el equipo. Recuerda leer las notas: lo que corresponde a DeepSeek viene de datos verificados en el brief; lo apuntado para Kimi K3 está marcado como posicionamiento de catálogo y no como cifra auditable, porque dependemos de ofertas que recambian cada pocas semanas.
- Datos verificados en local el 16/8/2026. Kimi K3 explícitamente marcado como sin cifra auditable en el brief.
- Repite la validación con pricing oficial antes de comprometer facturación de producción.
| Dimensión | DeepSeek V4 (Flash / Pro) | Kimi K3 (posicionamiento) |
|---|---|---|
| Foco | Calidad-precio y open source | Flagship de gran capacidad |
| Precio Flash (input/output) | 0,22 $ / 1,32 $ por M | n/d - depende de contexto |
| Precio output peak Pro | 3,96 $ por M | n/d - depende de contexto |
| Benchmark de agente | Terminal Bench 2.1: Flash 82,7 | n/d - sin datos auditados |
| DeepSWE | a favor de Flash | n/d - sin datos auditados |
| Thinking por defecto | Sí (Flash y Pro) | depende de la API |
| Licencia / open source | Abierto + harness MIT (preview) | depende del vendor |
| Mejor para | Startups lean y agencias con volumen | Casos que exigen máxima capacidad |
Self-hosting, open source y el futuro de la apuesta china
El componente no comercial de este duelo es el self-hosting: con modelos abiertos, en algún momento no pagas por token sino por equipo y energía. Ese es el lado open source del tablero chino, y la razón de que muchos proveedores apuesten por capas de despliegue propias. En DeepSeek, la licencia del harness y el modelo abierto permiten cargar el modelo en tu propio hardware y escapar a la métrica por carácter.
En HosT.ia trabajamos el open source en esa misma dirección: mantenemos herramientas propias abiertas y publicadas en GitHub, con la suite HosT.ia OS, POS, Guard y Chat, y un enfoque de agencia que busca agentes listos para producción en menos de 30 días, con SLA y un dashboard de monitorización. Esto quiere decir que no solo te decimos qué elegir: nos ocupa que lo despliegues, lo midas y lo cuides.
La tendencia es clara: el top chino ya no es una categoría para seguir de lejos, sino el lugar donde se prueban las variantes que abaratan los modelos. Kimi y DeepSeek van a seguir marcando el precio de referencia del mercado; si buscas rentabilidad, vuelve a la tabla y controla tu tráfico: Flash para el volumen, Pro para el trabajo duro y el flagship solo cuando tu caso lo justifique.
Preguntas frecuentes
¿Es mejor Kimi K3 o DeepSeek V4?
No hay un mejor absoluto. DeepSeek V4 con su versión Flash se centra en calidad-precio y open source; Kimi K3 se posiciona como el flagship grande y caro. Decide según tu caso de uso: volumen y margen o máxima capacidad, y valida siempre con tu workload.
¿Cuánto cuesta DeepSeek V4 Flash?
Datos verificados a 16/8/2026: 0,22 $ por millón de tokens de input en cache miss, 1,32 $ por millón de output en peak y 0,66 $ fuera de las horas punta. La V4 Pro sube hasta 3,96 $ por millón de output en peak.
¿Cuánto cuesta Kimi K3?
No viene una cifra verificada en nuestro brief. Kimi se posiciona como un flagship caro, pero el precio exacto por token depende del pricing oficial vigente en el día de la compra. Consulta la documentación del proveedor antes de presupuestar.
¿Es verdad que DeepSeek V4 ha subido los precios?
Sí, ha subido el precio respecto al ciclo anterior: DeepSeek pasó de 0,14 $ de input y 0,28 $ de output a los nuevos precios de V4, con una subida de hasta el 1100% en algunos casos. La calidad-precio sigue siendo competitiva, pero el punto de entrada global es superior: planifica el presupuesto acorde.
¿Qué benchmark público hay entre Flash y V4 Pro?
Según los datos publicados, V4 Flash 0731 supera a V4 Pro en nueve benchmarks. Un buen ejemplo es Terminal Bench 2.1, con Flash 82,7 frente a Pro 72,1, y también DeepSWE a favor de Flash. Orientado a tareas de agente y de software.
¿Qué significa Thinking por defecto en V4?
Que el chain-of-thought viene activado por defecto en la API de V4 Pro y V4 Flash. El razonamiento también consume tokens, así que mide input + output + razonamiento para estimar la factura real por request.
¿Qué es DeepSeek Harness v0.1 y para qué sirve?
Es un CLI llamado dsh, ejecutable con npx @deepseek-ai/dsh web, basado en Node.js y en el principio everything-is-a-plugin, sobre el meta-framework Cordis. Está publicado bajo MIT en estado Developer Preview y competir con la familia Claude Code y Codex.
¿Conviene DeepSeek V4 para una agencia que vende agentes?
Sí, y es de las que mejor sale: puedes hacer tier económico con Flash y tier premium con Pro, con SLA y monitorización para tu cliente. Empezar por Flash tiene sentido cuando valides que los benchmarks de agente, como Terminal Bench 2.1, se comportan bien en tu carga de trabajo: da confianza y mantiene el coste de producción bajo control.
Elegir entre Kimi K3 y DeepSeek V4 no debería ser un voto de modelo, sino una decisión de arquitectura con presupuesto y SLA encima de la mesa. En HosT.ia construimos agentes listos para producción en menos de 30 días, con monitorización, routing de modelos por coste y open source base publicado en GitHub. ¿Quieres ver cómo encajar DeepSeek V4 en tu stack con el coste controlado? Reserva una demo o una llamada de estrategia en hostia.solutions y lo validamos con datos reales.
Agentes listos para producción en menos de 30 días, con uptime garantizado por SLA y un dashboard de monitorización en vivo. Agenda una llamada estratégica gratuita.
Agenda una llamada