DeepSeek R2: el open source vuelve a apretar en razonamiento
El nuevo modelo de razonamiento de DeepSeek reabre la pregunta incómoda: ¿cuánta ventaja real les queda a los modelos cerrados de frontera?
Tag
8 artículos con este tag.
El nuevo modelo de razonamiento de DeepSeek reabre la pregunta incómoda: ¿cuánta ventaja real les queda a los modelos cerrados de frontera?
Qwen 3 llegó con una familia completa de modelos desde 0.6B hasta 235B, razonamiento nativo, y rendimiento que compite directamente con los mejores modelos cerrados. Análisis completo.
DeepSeek V3 compite directamente con GPT-4o en benchmarks y lo supera en algunos. Con acceso open source y coste de inferencia inferior, cambia el mapa de proveedores de LLMs.
Meta lanzó Llama 4 con arquitectura MoE, ventana de contexto masiva, y capacidades multimodales. Analizamos qué significa para el ecosistema open source.
DeepSeek V3 llegó con un rendimiento que compite directamente con GPT-4o y Claude 3.5 Sonnet, a un coste de entrenamiento que desafía las asunciones del sector.
Llama 3, Mistral y DeepSeek cerraron la brecha de calidad con GPT-4 y Claude. Pero la elección no es solo de rendimiento: hay licencias, infraestructura, latencia y privacidad en juego.
DeepSeek publicó R1 con pesos abiertos y rendimiento equivalente a OpenAI o1 en matemáticas y código. El impacto en el mercado fue inmediato y la discusión sobre eficiencia en el entrenamiento se reabrió.
Meta publicó Llama 3 con pesos descargables, contexto de 128K tokens y rendimiento competitivo con GPT-4. El ecosistema open source no había visto algo así desde el primer Llama.