05 ago 2026
DeepSeek V4 Flash en español: qué es, cómo funciona y a dónde van tus datos
Qué es DeepSeek V4 Flash, cómo consigue un contexto de un millón de tokens y a dónde van tus prompts cuando lo usas desde Europa.
DeepSeek V4 Flash es el modelo eficiente de la generación V4 de DeepSeek: un modelo de lenguaje mixture-of-experts con 284.000 millones de parámetros totales, 13.000 millones activos por token, una ventana de contexto de un millón de tokens y pesos abiertos bajo licencia MIT. DeepSeek lo publicó en preview el 24 de abril de 2026 y lanzó la versión oficial el 31 de julio de 2026. En ilisai puedes usarlo en español, desde el navegador, pagando en euros y sin cuenta de DeepSeek: es uno de los modelos seleccionables del chat, facturado por token en créditos.
Esta guía cuenta qué cambió con la generación V4, la arquitectura que abarata la ventana de un millón de tokens, qué sabe y qué no sabe hacer el modelo, cómo se usa en ilisai y —dado que el laboratorio detrás del modelo es chino y tú probablemente escribes desde Europa— a dónde van exactamente tus prompts.
¿Qué es DeepSeek V4 Flash?
DeepSeek V4 Flash (id de modelo deepseek-v4-flash) es el menor de los dos modelos que DeepSeek anunció el 24 de abril de 2026 junto al buque insignia V4-Pro. Los dos son pesos abiertos bajo MIT. Pro tiene 1,6 billones de parámetros totales con 49.000 millones activos; Flash se queda en 284.000 millones totales y 13.000 millones activos, y de ahí salen su velocidad y su precio. En la propia API de DeepSeek, Flash cuesta 0,12 € por millón de tokens de entrada y 0,24 € por millón de salida — alrededor de un tercio de la tarifa de salida de Pro, que está en 0,75 €.
La cronología:
- 24 de abril de 2026 — DeepSeek publica la generación V4 en preview: V4-Pro y V4-Flash, pesos abiertos, con el contexto de un millón de tokens como valor por defecto en todos sus servicios oficiales.
- 26 de abril de 2026 — llega a arXiv el informe técnico que describe la arquitectura de atención híbrida que repasamos más abajo.
- 31 de julio de 2026 — DeepSeek publica DeepSeek-V4-Flash-0731, la versión oficial que cierra la fase de preview de Flash (lo recogió Caixin Global); el endpoint
deepseek-v4-flashde la API apunta ya a esta versión.
Un apunte para quien use la API de DeepSeek directamente: su documentación de precios avisa de que la API adoptará próximamente tarifas de hora punta —el doble durante las horas pico de Pekín—, con la fecha de entrada en vigor pendiente de anuncio. Los precios de ilisai no cambian por ello.
Cómo se vuelve asequible un millón de tokens
El contexto largo siempre ha sido caro por la atención: en un transformer clásico, cada token nuevo atiende a todos los anteriores, así que el cómputo crece con el cuadrado de la secuencia y la caché KV, con su longitud. El informe técnico de V4 (arXiv:2606.19348) lo ataca con dos mecanismos de atención que se alternan por capas:
- CSA (Compressed Sparse Attention) comprime grupos de entradas clave-valor en bloques y deja que cada consulta atienda solo a los bloques más relevantes —los elige un indexador ligero, el «lightning indexer»— más una ventana deslizante de tokens recientes para el detalle local.
- HCA (Heavily Compressed Attention) comprime de forma mucho más agresiva y prescinde de la selección: cada consulta atiende de forma densa a todo el flujo comprimido, manteniendo una vista global barata del contexto completo.
Una tercera pieza, mHC (manifold-constrained hyper-connections), rediseña las conexiones residuales entre capas para que la señal se propague de forma estable a esta escala. El resultado se puede medir: según el informe técnico, V4-Pro con un contexto de un millón de tokens necesita solo el 27% del cómputo de inferencia por token y el 10% de la memoria de caché KV que necesitaba DeepSeek V3.2 — y Flash es la variante pequeña y barata de ese mismo diseño. En la práctica, puedes pasarle un libro entero, la exportación de un repositorio o una carpeta de informes con total normalidad.
Qué sabe hacer el modelo
DeepSeek V4 Flash lee hasta un millón de tokens de contexto, razona por defecto, llama a herramientas, cachea automáticamente el contexto repetido y solo acepta texto. El detalle, según la documentación de DeepSeek, la página del modelo en Fireworks y la propia integración de ilisai:
| Capacidad | DeepSeek V4 Flash |
|---|---|
| Ventana de contexto | Un millón de tokens |
| Salida máxima | 32.768 tokens por respuesta en ilisai — el tope de salida del chat en todo el producto; el endpoint de Fireworks admite hasta 131.072 |
| Entradas | Solo texto — sin imágenes ni archivos |
| Razonamiento | Modo de razonamiento activado por defecto, con niveles de esfuerzo |
| Herramientas | Llamadas a funciones, con varias rondas de razonamiento y herramientas |
| Caché | Caché de contexto activada por defecto, sin cambios de código |
| Licencia | MIT, pesos abiertos |
Modo de razonamiento. El modelo razona antes de responder, y en la API de DeepSeek ese es el comportamiento por defecto (esfuerzo por defecto: alto). V4 Flash acepta tres niveles de esfuerzo —bajo, alto y máximo—. Una rareza que conviene saber: en modo razonamiento la API ignora por completo temperature, top_p y los parámetros de penalización, así que todo se dirige desde el prompt (guía de thinking mode de DeepSeek).
Herramientas. El modelo puede encadenar varias rondas de razonamiento y llamadas a herramientas antes de comprometerse con una respuesta (misma guía). Sumado al contexto largo, es el perfil de un modelo pensado para cargas de trabajo de agentes, no solo para conversar.
Caché implícita. DeepSeek activa la caché de contexto en todas las peticiones sin cambios de código: los prefijos repetidos del prompt se recuperan de la caché y se facturan a una fracción de la tarifa normal de entrada (documentación de caché de contexto de DeepSeek). Fireworks aplica la misma idea en su plataforma: la entrada cacheada se factura a 0,024 € por millón de tokens frente a los 0,12 € de la entrada nueva.
Solo texto. El modelo no acepta imágenes ni archivos como entrada — la página del modelo en Fireworks indica que la entrada de imagen no está soportada. En ilisai, el botón de adjuntar se desactiva cuando seleccionas DeepSeek V4 Flash, para que lo sepas antes de montar un flujo de trabajo encima, no después. Pega el texto directamente: con un millón de tokens de sitio, pegar casi nunca es el cuello de botella.
DeepSeek V4 Flash en ilisai
DeepSeek V4 Flash está disponible en el chat de ilisai: inicia sesión, abre el selector de modelos, elígelo y escribe — en español o en el idioma que quieras. Sin cuenta de DeepSeek, sin clave de API y sin otra factura: los créditos incluidos en tu plan se gastan en este modelo igual que en cualquier otro del catálogo.
Para documentos muy largos es un modelo especialmente cómodo: en ilisai una conversación admite alrededor de 770.000 tokens de entrada, tras la reserva que ilisai aparta para la respuesta — un contexto donde siguen cabiendo varias novelas. La alternativa para desarrolladores es la API de Fireworks, donde el mismo modelo cuesta 0,12 € de entrada y 0,24 € de salida por millón de tokens, con su propia clave de API y otra factura aparte. En ilisai no necesitas nada de eso: cualquier plan, del Gratis en adelante, incluye créditos que valen para este modelo, y lo que exceda tus créditos incluidos sale de tu monedero.
Si quieres ver el modelo trabajando antes de escribir tus propios prompts, nuestra biblioteca de prompts para DeepSeek en español reúne ocho prompts listos para copiar, afinados a lo que este modelo hace mejor — el trabajo con documentos largos incluido.
Usarlo desde Europa: a dónde van tus prompts
En ilisai, los prompts que envías a DeepSeek V4 Flash van a Fireworks AI, un proveedor de inferencia estadounidense que no retiene datos por defecto — nunca a DeepSeek. La duda es razonable tratándose del modelo de un laboratorio chino, así que vamos por partes:
- Tus prompts van a Fireworks, no a DeepSeek. ilisai ejecuta el modelo de pesos abiertos mediante una integración directa y fija con Fireworks AI, un proveedor de inferencia estadounidense, en su plataforma serverless. Las peticiones no pasan nunca por la API de DeepSeek ni por ningún proveedor chino — la licencia MIT es lo que lo hace posible: cualquiera puede alojar los pesos, e ilisai eligió quién lo hace.
- Fireworks no retiene datos por defecto. Según la documentación de tratamiento de datos de Fireworks, los prompts y las respuestas de los modelos serverless existen solo en memoria volátil mientras dura la petición y no se registran en almacenamiento persistente; con la caché de prompts activa, los prefijos cacheados pueden permanecer en memoria volátil unos minutos.
- La región de inferencia depende de Fireworks. Fireworks ofrece DeepSeek V4 Flash en su plataforma serverless global, sin compromiso de región concreta para este modelo. Las cuentas, los chats y la facturación de ilisai operan bajo el RGPD como producto de una empresa europea; la inferencia de este modelo se rige por las condiciones de Fireworks enlazadas arriba.
ilisai reúne modelos punteros y eficientes de varios proveedores bajo una sola cuenta con precios en euros, y esta información se da modelo a modelo, antes de que confíes un flujo de trabajo a uno de ellos. Nuestra comparativa de opciones de IA europeas amplía el cuadro de la soberanía digital.
Empieza a usar IA hoy
Crea tu cuenta gratuita y accede a múltiples modelos de IA desde una sola interfaz.
Preguntas frecuentes
¿Qué es DeepSeek V4 Flash?
El modelo eficiente de la generación V4 de DeepSeek: mixture-of-experts de 284.000 millones de parámetros con 13.000 millones activos, ventana de contexto de un millón de tokens, modo de razonamiento y uso de herramientas, publicado como pesos abiertos bajo MIT. La preview salió el 24 de abril de 2026; la versión oficial, el 31 de julio de 2026.
¿Mis prompts van a China?
No. ilisai ejecuta el modelo de pesos abiertos en Fireworks AI, un proveedor de inferencia estadounidense, y las peticiones no tocan la API de DeepSeek ni ningún proveedor chino. Fireworks no retiene datos por defecto en su plataforma serverless, que es global y no garantiza una región concreta.
¿Responde bien en español?
Escríbele en español y te responde en español; DeepSeek, además, documenta las capacidades multilingües del modelo. Como con cualquier modelo, ayuda declarar el registro que quieres —tú o usted, técnico o divulgativo— y pedir redacción natural cuando el texto vaya a publicarse. La biblioteca de prompts en español trae los ejemplos ya escritos.
¿Puedo adjuntar imágenes o archivos?
Con este modelo, no: DeepSeek V4 Flash es solo texto, e ilisai desactiva el botón de adjuntar cuando lo seleccionas. Pega el texto directamente en el chat: la ventana de un millón de tokens deja sitio de sobra. Para trabajo que necesite imágenes de entrada, elige otro modelo del catálogo.
¿Cuánto texto cabe en la ventana de contexto?
Un millón de tokens según la ficha del modelo: varias novelas largas, o la documentación de un proyecto grande. En ilisai, una conversación admite alrededor de 770.000 tokens de entrada tras la reserva que se aparta para la respuesta, y cada respuesta tiene un tope de 32.768 tokens — el límite de chat de todo el producto. El modelo admite hasta 131.072 tokens de salida cuando llamas a Fireworks directamente.
¿Puedo usarlo en el plan Gratis?
Sí. El plan Gratis incluye 400 créditos al mes, con un máximo de 150 al día, para cualquier modelo del catálogo, DeepSeek V4 Flash incluido; los trabajos más grandes pueden salir de tu monedero en cualquier plan.
¿Y DeepSeek V4 Pro?
V4-Pro es el buque insignia de la misma generación, con 1,6 billones de parámetros, también con pesos abiertos bajo MIT. ilisai no lo ofrece: la entrada de DeepSeek en el catálogo es Flash, elegido por su relación precio-capacidad.