2025 fue el año en que dejamos de hablar de “¿funcionan los LLMs?” y empezamos a hablar de “¿cómo los ponemos en producción sin que exploten?”. Eso es progreso real, aunque no siempre se sienta así desde dentro.
Lo que prometió y cumplió
El razonamiento extendido se volvió real. o1 a principios de año, Grok 3, o3 hacia final de año: los modelos que “piensan antes de responder” demostraron ser genuinamente mejores en tareas de matemáticas, lógica y código complejo. No es marketing, los benchmarks y el uso real lo confirman.
Los modelos pequeños se volvieron sorprendentemente capaces. Phi-3, Gemma 2, Llama 3.1 8B: modelos que corren en un portátil decente resuelven problemas que hace dos años requerían modelos de cien mil millones de parámetros. Esto cambió la ecuación para aplicaciones de privacidad y edge computing.
El coste de los LLMs bajó drásticamente. El precio por millón de tokens de los modelos top bajó aproximadamente un 80% respecto a 2023. Lo que antes era caro de prototipar ahora es barato de producir.
Los agentes empezaron a funcionar en casos acotados. No el “agente que hace todo” que prometían los demos, sino agentes que hacen una tarea específica bien: revisar PRs, generar tests, procesar documentos. El ámbito acotado es clave.
Lo que prometió y no cumplió
Los agentes generales siguen siendo una promesa. “El agente que navega por internet, escribe código, manda emails y coordina reuniones” sigue fallando más de lo aceptable en producción. El 80% de las tareas funciona, el 20% falla de formas que ningún usuario quiere gestionar.
La fiabilidad en producción sigue siendo el problema principal. Los modelos son increíblemente capaces en media pero sus fallos son impredecibles. Para muchos casos de negocio, la impredecibilidad es inaceptable aunque la media sea buena.
El hardware de IA para consumidores no despegó. Rabbit R1, Humane AI Pin, y todos los dispositivos de hardware IA que se lanzaron a principios de año fueron fracasos comerciales. El teléfono con una app sigue ganando.
Las tendencias que definieron 2025
MCP (Model Context Protocol) como estándar emergente. La propuesta de Anthropic para estandarizar cómo los modelos acceden a herramientas externas ganó adopción rápida. No es perfecto pero llena un hueco real.
Open source alcanzando a los modelos cerrados. En 2024, GPT-4 estaba a años luz de los mejores modelos open source. En 2025, la distancia se redujo dramáticamente. Llama 3.1 405B y Qwen 2.5 son competitivos en muchas tareas.
La explosión del ecosistema de herramientas. Cursor, Windsurf, GitHub Copilot Workspace, Devin: las herramientas de código asistido por IA se volvieron parte del flujo de trabajo estándar para muchos equipos.
Qué esperar de 2026
Sin bola de cristal, pero las tendencias apuntan a:
- Más razonamiento, más fiable, más barato
- Agentes que funcionan en dominios más amplios (aunque todavía no en todo)
- Modelos multimodales con capacidades de video más maduras
- Regulación más concreta en Europa y algunos estados de EE.UU.
- Consolidación del mercado: hay demasiados LLMs genéricos, algunos desaparecerán
2026 no será el año de la AGI (aunque alguien lo proclamará). Será el año en que la IA de 2024-2025 aterrice en producción de verdad, con todos los problemas de ingeniería que eso implica.
Opinión del equipo editorial basada en seguimiento del sector durante 2025.