21 ago 2026 · modelos · benchmarks
Inteligencia vs precio: cómo leer el ranking sin autoengañarte
Un índice único compacta GPQA, código y matemáticas. Útil para filtrar, insuficiente para elegir.

OpenRouter expone `benchmarks.artificial_analysis` con Intelligence, Coding y Agentic index. Ordenar por inteligencia-high-to-low es el atajo para ver el frente. El error clásico es tratar el índice como verdad del producto: un modelo top en GPQA puede ser peor en tool use o en tu idioma.
El Chatbot Arena (LMArena) mide preferencia humana, no accuracy. Hugging Face Daily Papers enseña qué se está investigando esta semana, no qué debes poner en producción. Mezclamos las tres señales en Tendencias: ranking de inteligencia, open-weight con más likes, y papers del día.
Para una decisión de compra: 1) recorta por contexto y modalidad, 2) recorta por precio blended de tu mix real, 3) mira coding vs agentic según el job, 4) prueba 50 tareas tuyas. El leaderboard público es el embudo, no el veredicto.