Modelos multimodales para devs: más allá de 'describe esta imagen'
La visión en los LLMs pasó de juguete a herramienta de trabajo. Casos reales donde pasar imágenes a un modelo resuelve problemas que el texto solo no podía.
Tag
13 artículos con este tag.
La visión en los LLMs pasó de juguete a herramienta de trabajo. Casos reales donde pasar imágenes a un modelo resuelve problemas que el texto solo no podía.
Los modelos de razonamiento piensan antes de responder y aciertan más en tareas duras. También tardan más y cuestan más. Una guía sin hype para decidir cuándo usarlos.
Las ventanas de contexto gigantes ya son normales. La pregunta no es si caben tus documentos, sino si el modelo los usa bien. Lo que aprendí metiendo repos enteros.
Mientras todos miraban al frontier, los modelos de 1 a 8B se volvieron sorprendentemente buenos. Por qué el futuro de la mayoría de aplicaciones es pequeño y local.
El nuevo modelo de razonamiento de DeepSeek reabre la pregunta incómoda: ¿cuánta ventaja real les queda a los modelos cerrados de frontera?
Entre filtraciones, declaraciones oficiales y expectativas infladas, intentamos separar la señal del ruido sobre el próximo modelo de frontera de OpenAI.
Qwen 3 llegó con una familia completa de modelos desde 0.6B hasta 235B, razonamiento nativo, y rendimiento que compite directamente con los mejores modelos cerrados. Análisis completo.
Gemini 2.5 Pro llegó con razonamiento nativo, 1M de contexto por defecto, y resultados en código que por primera vez hacen a Google competitivo con Anthropic y OpenAI en uso real.
OpenAI actualizó su modelo principal con GPT-4.1. Mejor en código, instrucciones largas, y coste reducido. Analizamos los cambios reales y si justifican migrar desde GPT-4o.
Claude 3.5 Haiku llegó para llenar el hueco entre velocidad y calidad en la línea de Anthropic. Benchmarks, casos de uso, y comparación con GPT-4o mini.
DeepSeek V3 llegó con un rendimiento que compite directamente con GPT-4o y Claude 3.5 Sonnet, a un coste de entrenamiento que desafía las asunciones del sector.
xAI lanzó Grok 3 con capacidades de razonamiento extendido y acceso a datos de X en tiempo real. Analizamos qué lo diferencia y cuándo tiene sentido usarlo.
GitHub integró un marketplace de modelos donde puedes experimentar con GPT-4o, Llama 3 y otros directamente desde github.com, con créditos gratuitos para desarrollo y una API unificada.