El blog de Mickel

Notas desde Shenzhen sobre código, China y fútbol.

← Entradas recientes

2 de septiembre de 2026

DeepSeek aprieta el acelerador multimodal: Flash-Vision y el modo "visión" llega a web y app

IA multimodal

DeepSeek libera los pesos de su primer modelo multimodal de la familia V4 y activa el modo de lectura de imágenes en su plataforma. El movimiento combina ultranza open source con un enfoque técnico propio —"pensar con primitivas visuales" (视觉原语)— que vuelve a colocar a la compañía un paso por delante de la competencia doméstica.

Hace apenas unos días, DeepSeek había sorprendido con la irrupción de V4, demostrando que se puede entrenar con presupuesto contenido y abriendo la arquitectura a la comunidad. Ahora llega el siguiente golpe sobre la mesa: DeepSeek-V4-Flash-Vision-Exp, su primer modelo experimental multimodal, ya disponible tanto como pesos abiertos en Hugging Face como a través del modo "visión" (识图模式) activo en web y aplicaciones.

Modelo abierto, visión nativa

El nuevo modelo parte de la arquitectura de DeepSeek-V4-Flash y le incorpora módulos visuales con entrenamiento continuado para desbloquear la comprensión de imágenes. No se trata de un "pegado" de un codificador visual sobre un modelo de texto, como hicieron otros fabricantes hace meses: la investigación de pesos apunta a visión nativa, entrenada en la propia arquitectura.

La apuesta open source se mantiene intacta. El repositorio oficial documenta cómo ejecutar el modelo con vLLM y SGLang, y la licencia MIT permite su uso comercial sin cortapisas. La comunidad ya ha publicado variantes cuantizadas (fp8) para desplegarlo en hardware modesto.

Rendimiento que presiona a la competencia occidental

La comparativa publicada por la propia DeepSeek tiene miga. Frente a DeepSeek-V4-Flash-0731:

- Capacidades de agente multimodal: ApexBench pasa de 26.2 a 36.5 (Pass@1); Chartography marca 64.3. - Capacidades de agente de texto: se mantienen o mejoran (Terminal Bench 2.1: 83.9; NL2Repo: 57.7; DSBench-Hard: 63.6).

Y lo más relevante a nivel de mercado: en ese mismo cuadro figura Opus-4.8 como referencia. El modelo de DeepSeek iguala o supera al referente occidental en varias pruebas multimodales (ZeroBench: 35.0 frente a 34.0; Agents' Last Exam: 27.3 frente a 25.7), compitiendo de tú a tú con un escalón de acceso que ya no juega a favor de Occidente. Cuando el competidor es de pago y cerrado, y tú eres abierto, gratuito y de bajo coste de inferencia, la conversación comercial cambia por completo.

"Pensar con primitivas visuales": el enfoque diferencial

El modelo no se limita a "ver" y describir. Su diseño persigue que el sistema razone a partir de elementos visuales estructurados (formas, tablas, diagramas, coordenadas) como unidades de pensamiento, no como píxeles a comprimir. Es un cambio conceptual frente al patrón "tower + LLM" que dominó la generación anterior.

Ese énfasis en agentes que entienden entornos visuales —gráficos, capturas, formularios— apunta directamente a usos de agente combinados: leer una imagen, extraer la tarea, planificar y ejecutarla. Reconocimiento de cuadros, OCR estructural e interfaces gráficas caen dentro de su alcance.

Peso sobre la competencia doméstica

DeepSeek combina, una vez más, los tres factores que sus rivales internos no logran replicar a la vez:

1. Pesos abiertos bajo licencia permisiva y comunidad activa en Hugging Face. 2. Visión nativa sin depender de componentes propietarios ajenos. 3. Coste de inferencia bajo, que convierte al modelo en la opción por defecto para startups y equipos de producto.

A esto se suma el modo "visión" ya operativo en web y app: mientras otros anuncian roadmaps, DeepSeek pone la función en manos del usuario final ese mismo día. Cuando el competidor interno sigue atado a su ecosistema cerrado o a planes de monetización, DeepSeek regala la mejor carta de la baraja y observa cómo reacciona el resto de la mesa.

DeepSeek-V4-Flash-Vision-Exp no es simplemente "un LLM que ve imágenes". Es la consolidación de una estrategia: abrir lo que otros cierran, pensar en primitivas lo que otros diseñan como accesorio, y ejecutar en tiempo real lo que otros anuncian como futuro. En la carrera multimodal de 2026, DeepSeek ha vuelto a mover ficha primero —y con los pesos sobre la mesa.

Fuente: repositorio oficial deepseek-ai/DeepSeek-V4-Flash-Vision-Exp en Hugging Face y anuncios de la plataforma API de DeepSeek. Imagen: Generada por Kraaki.com

Publicado por Roberto Mickel · Etiquetas: Deepseek

Suscribirse al blog

Dos formas de que te llegue lo que publique, y las dos van directas de aquí a ti.

Por RSS

Pega esta dirección en un lector de feeds y las entradas nuevas te llegan solas, sin dar el correo a nadie y sin que ninguna red decida si te lo enseña.

Abrir el feed — ahí se explica qué es esto y con qué se lee, por si no lo has usado nunca.

Por correo

Escríbeme y te aviso cuando publique. Lo llevo a mano: no es un boletín semanal, es un aviso cuando hay algo que leer.

Pedir el alta por correo

Tu dirección llega a mi buzón y se queda ahí: no hay lista en ningún servicio de terceros.