Modelos multimodales para devs: más allá de 'describe esta imagen'
La visión en los LLMs pasó de juguete a herramienta de trabajo. Casos reales donde pasar imágenes a un modelo resuelve problemas que el texto solo no podía.
Tag
8 artículos con este tag.
La visión en los LLMs pasó de juguete a herramienta de trabajo. Casos reales donde pasar imágenes a un modelo resuelve problemas que el texto solo no podía.
OpenAI integró generación de imágenes directamente en GPT-4o, creando un modelo verdaderamente multimodal. Qué gana esto respecto a DALL-E separado y cuáles son las limitaciones.
El procesamiento de video por LLMs pasó de experimental a útil en casos específicos. Revisamos qué modelos pueden hacer con video, las limitaciones reales, y los casos de uso viables.
Meta lanzó Llama 4 con arquitectura MoE, ventana de contexto masiva, y capacidades multimodales. Analizamos qué significa para el ecosistema open source.
Gemini 2.0 Flash y Pro cambian el enfoque de Google: menos competir en benchmarks generales, más habilitar flujos de trabajo agénticos con capacidades nativas de audio y video.
Los LLMs con capacidad visual ya no son novedad, pero sus capacidades reales varían mucho. Repasamos qué funciona bien en visión, dónde fallan todavía y las arquitecturas que lo hacen posible.
Google amplió el contexto de Gemini 1.5 Pro a 1 millón de tokens y, en versión experimental, a 2 millones. Qué cambia cuando puedes meter un codebase entero en el prompt.
OpenAI fusionó texto, audio e imagen en un solo modelo con GPT-4o. Repaso de qué significa esto para el desarrollo de aplicaciones y dónde sigue siendo la mejor opción.