Módulo 01 · 13 min
El panorama de modelos en 2026: cuál para construir
El módulo 0 te dio el mapa base de modelos. Aquí lo aterrizamos al presente: qué familias mandan HOY para construir y cuándo elegir cuál. Un aviso honesto antes de empezar: esto envejece rápido. Cuando leas esto quizá haya versiones más nuevas. No memorices los números — memoriza el criterio, que no caduca.
🔒 Grandes cerrados
Máxima capacidad, sin administrar nada. Los usas por API.
🔓 Abiertos (open-source)
Los corres tú: control, privacidad, costo a escala.
Regla que no caduca: para tu primer producto, el mejor cerrado que puedas pagar. Optimiza después.
Anthropic (Claude) — mi apuesta para código
A mediados de 2026 la familia Claude va así: Haiku (rápido y barato) para tareas masivas y simples; Sonnet como el caballo de batalla del día a día; Opus para trabajo pesado de razonamiento y código; y por arriba, modelos frontera tipo Fable que empujan el techo de lo posible. Claude sigue siendo mi favorito para construir por lo cuidadoso que es siguiendo instrucciones y por no perderse en tareas largas de código.
OpenAI (GPT) — el más versátil y el mejor ecosistema
La familia GPT-5.6 (julio 2026) viene en tres tiers con nombres propios: Sol (el tope, para lo más difícil: código complejo, investigación, seguridad), Terra (el equilibrado del día a día: soporte, herramientas internas, análisis de documentos) y Luna (el más barato y rápido: resumir, redactar, automatizar). Sol compite cabeza a cabeza con lo mejor de Anthropic en código, y Terra ofrece rendimiento fuerte a mitad de precio. OpenAI también tiene Codex, su línea agéntica de programación. Es la opción más versátil y con más integraciones a su alrededor.
Google (Gemini) — multimodal y contexto gigante
Gemini 3.x pelea en la cima de los benchmarks de código (ronda el 80% en SWE-bench Verified) y brilla especialmente en dos cosas: multimodal de verdad (imagen, video, audio) y ventanas de contexto enormes, lo que ayuda cuando le metes un proyecto entero o documentos largos. Si ya vives en Google Cloud, integra de forma natural.
xAI (Grok) — fuerte en razonamiento duro
Grok (4.x) tiende a lucir en benchmarks de razonamiento puro, matemáticas y ciencia dura, con contexto de hasta un millón de tokens y buen uso de herramientas. Si tu carga es lógica pesada o problemas tipo olimpiada, entra a la conversación; para construir productos web del día a día, no es donde yo empezaría.
Los open-weight (DeepSeek, Kimi, Qwen, GLM, Llama, Mistral)
La historia de 2026 en open-weight la dominan laboratorios chinos: DeepSeek (V4) alcanza a modelos cerrados en código a una fracción del costo; Kimi, Qwen y GLM también compiten fuerte. Del lado occidental, Llama (Meta) y Mistral juegan de alternativas con licencias más cómodas para empresas de EE. UU./Europa. Ventaja de todos: control, privacidad y costo a escala. Desventaja: más trabajo de montaje y, salvo excepciones, van un paso atrás de la frontera cerrada.
ℹ️ Cómo elijo yo, en una frase por caso
Para construir productos en serio: el modelo cerrado más capaz que mi presupuesto permita (hoy, Claude para código). Para tareas simples y masivas (clasificar, rutear, resumir en volumen): el tier más barato y rápido de cualquier familia. Para privacidad total o costo a gran escala: evalúo un open-weight como DeepSeek o Llama.
Ejemplo trabajado: elegir modelo para 3 tareas de Momentum
Imagina que ya construyes tu diario con IA. Tres tareas, tres elecciones distintas:
- Escribir el código de la app (agente que edita varios archivos) → un tier ALTO de código (Opus/GPT tope/Gemini Pro). Aquí la capacidad vale más que el costo.
- El coach de IA que resume la entrada del día de cada usuario, miles de veces → un tier MEDIO o BAJO (Haiku, o el tier ligero de GPT). Barato y rápido, porque corre muchísimo.
- Analizar datos sensibles de salud de usuarios sin que salgan de tu servidor → un open-weight que corras tú mismo. Aquí la privacidad manda sobre todo lo demás.
⚠️ No te cases con una marca
El error de novato es volverse 'fan' de un modelo y usarlo para todo. El profesional mueve cuatro perillas según la tarea: capacidad, velocidad, costo y privacidad. Aprende a moverlas y elegirás bien aunque salgan diez modelos nuevos el mes que viene.
Lo que te llevas
- Cada familia tiene un tier ligero, uno medio y uno tope: elige el tier por la tarea, no por moda.
- Claude para código, GPT por versatilidad/ecosistema, Gemini por multimodal y contexto, Grok por razonamiento duro, open-weight por control/costo.
- Las 4 perillas: capacidad vs. velocidad vs. costo vs. privacidad.
- El panorama cambia cada mes — el criterio de elección no.
No aprendas los modelos de memoria. Aprende a elegir. Los nombres cambian; el criterio, no.
Claude, Cursor, Codex, Antigravity y compañía
Siguiente →Benchmarks: cuáles importan y cuáles son marketing
Comentarios
Inicia sesión (arriba) para leer y participar en la conversación de la comunidad.