Modelos multimodales para devs: más allá de 'describe esta imagen'
La visión en los LLMs pasó de juguete a herramienta de trabajo. Casos reales donde pasar imágenes a un modelo resuelve problemas que el texto solo no podía.
Categoría
28 artículos en esta categoría.
La visión en los LLMs pasó de juguete a herramienta de trabajo. Casos reales donde pasar imágenes a un modelo resuelve problemas que el texto solo no podía.
Las ventanas de contexto gigantes ya son normales. La pregunta no es si caben tus documentos, sino si el modelo los usa bien. Lo que aprendí metiendo repos enteros.
Mientras todos miraban al frontier, los modelos de 1 a 8B se volvieron sorprendentemente buenos. Por qué el futuro de la mayoría de aplicaciones es pequeño y local.
El nuevo modelo de razonamiento de DeepSeek reabre la pregunta incómoda: ¿cuánta ventaja real les queda a los modelos cerrados de frontera?
Entre filtraciones, declaraciones oficiales y expectativas infladas, intentamos separar la señal del ruido sobre el próximo modelo de frontera de OpenAI.
Qwen 3 llegó con una familia completa de modelos desde 0.6B hasta 235B, razonamiento nativo, y rendimiento que compite directamente con los mejores modelos cerrados. Análisis completo.
Anthropic actualizó su línea Opus con Claude 4.5, apostando por capacidades de razonamiento extendido y rendimiento en tareas complejas. Análisis completo y casos de uso.
DeepSeek V3 compite directamente con GPT-4o en benchmarks y lo supera en algunos. Con acceso open source y coste de inferencia inferior, cambia el mapa de proveedores de LLMs.
Gemini 2.5 Pro llegó con razonamiento nativo, 1M de contexto por defecto, y resultados en código que por primera vez hacen a Google competitivo con Anthropic y OpenAI en uso real.
Meta lanzó Llama 4 con arquitectura MoE, ventana de contexto masiva, y capacidades multimodales. Analizamos qué significa para el ecosistema open source.
OpenAI actualizó su modelo principal con GPT-4.1. Mejor en código, instrucciones largas, y coste reducido. Analizamos los cambios reales y si justifican migrar desde GPT-4o.
Anthropic lanzó Claude 3.7 Sonnet con Extended Thinking activable. Analizamos qué cambia en la práctica, cuándo activarlo, y los trade-offs de latencia y coste.
La familia Phi de Microsoft demostró que el tamaño no lo es todo. Phi-4 lleva esa filosofía más lejos con un modelo de 14B que compite en razonamiento con modelos mucho más grandes.
Gemini 2.0 Flash y Pro cambian el enfoque de Google: menos competir en benchmarks generales, más habilitar flujos de trabajo agénticos con capacidades nativas de audio y video.
Claude 3.5 Haiku llegó para llenar el hueco entre velocidad y calidad en la línea de Anthropic. Benchmarks, casos de uso, y comparación con GPT-4o mini.
DeepSeek V3 llegó con un rendimiento que compite directamente con GPT-4o y Claude 3.5 Sonnet, a un coste de entrenamiento que desafía las asunciones del sector.
o3 supera a o1 en todos los benchmarks relevantes y alcanza rendimiento humano experto en tareas de ciencia. Qué significa esto y qué limitaciones tiene.
xAI lanzó Grok 3 con capacidades de razonamiento extendido y acceso a datos de X en tiempo real. Analizamos qué lo diferencia y cuándo tiene sentido usarlo.
La familia Qwen 2.5 de Alibaba incluye variantes especializadas en código y matemáticas, con soporte sobresaliente para idiomas asiáticos y rendimiento competitivo en benchmarks occidentales.
o1 es el primer modelo de OpenAI que genera una cadena de razonamiento interna antes de responder. Cambia la relación coste-calidad para problemas complejos y exige replantear cómo se hacen los prompts.
Microsoft publicó Phi-3 Mini con 3.8B parámetros y rendimiento de modelo mediano. El experimento demuestra que la calidad de los datos de entrenamiento puede compensar el tamaño del modelo.
Google publicó Gemma 2 con variantes de 2B, 9B y 27B parámetros. El modelo de 9B supera a Llama 3 8B en benchmarks clave y corre en consumer hardware sin grandes concesiones.
DeepSeek publicó R1 con pesos abiertos y rendimiento equivalente a OpenAI o1 en matemáticas y código. El impacto en el mercado fue inmediato y la discusión sobre eficiencia en el entrenamiento se reabrió.
Mistral AI lanzó Large 2 con 123B parámetros, ventana de 128K tokens y rendimiento que rivaliza con GPT-4o. Disponible como pesos descargables y como API, con enfoque en idiomas europeos.
Meta publicó Llama 3 con pesos descargables, contexto de 128K tokens y rendimiento competitivo con GPT-4. El ecosistema open source no había visto algo así desde el primer Llama.
Google amplió el contexto de Gemini 1.5 Pro a 1 millón de tokens y, en versión experimental, a 2 millones. Qué cambia cuando puedes meter un codebase entero en el prompt.
OpenAI fusionó texto, audio e imagen en un solo modelo con GPT-4o. Repaso de qué significa esto para el desarrollo de aplicaciones y dónde sigue siendo la mejor opción.
Anthropic lanzó Claude 3.5 Sonnet y superó a GPT-4o en la mayoría de pruebas de razonamiento y código. Qué cambia para los desarrolladores y qué limitaciones sigue teniendo.