Пять тестов, которые реально меряют инженера

Сначала ступени и агенты (проба → код → агенты → сложно → GURU). Ниже сводная каталога.

Лента
Цены и скидки vs официальный прайс
Как считаем цену и балл
Как выбираем самого дешёвого. Берём только обычную онлайн-цену (не batch и не :flex). Смесь = 75% input + 25% output за 1M токенов. Если цены отличаются меньше чем на 1% — ничья, подсвечиваются все. Отдельно считаем победителя среди агрегаторов (OpenRouter, Requesty, Vercel, NanoGPT, APIMaster, Hugging Face) и среди хостеров (DeepInfra, Novita, Together, Fireworks, Groq, PPInfra, SambaNova). Вендорский list берём из models.dev/api.json (OpenAI, Anthropic, Google, xAI, Groq, Fireworks, SiliconFlow, Cerebras, DeepSeek, Z.ai, Moonshot…) — это открытая база без ключа, не живой /v1/models вендора. Запасной слой — aipricing.guru. Колонка «скидка» = насколько самый дешёвый оффер дешевле этого list. APIMaster — площадка каналов со скидкой (часто 80–97% от официальной). Не Anthropic/OpenAI: fingerprint-каналы. В popover «все цены» видны in/out, официальная смесь и %. Сырые релеи (Atlas Cloud, UiUiAPI, Relaydance, bltcy…) помечены «сырая»: снимок цен, канал не проверяли. В колонку «Смесь $» они не входят. Кнопка «+ комиссия» добавляет 5.5% OpenRouter и 5% Requesty. Интеллект — наша шкала по поколению и классу модели (Opus/Sol/Pro выше Flash/Haiku/mini). Снимок бенчмарков: DeepSWE (Datacurve/BenchLM), TB 2.1 и SWE-Pro (CodingFleet/вендоры), HLE и LiveCodeBench (BenchLM/Vals). Если у модели нет TB 2.1 — в ячейке курсивом соседний агент-тест той же категории (MCP Atlas или Vals TB 2.0). Если нет SWE-Pro — DeepSWE, SWE-Verified, FrontierCode или Vals SWE. HLE, LCB и TB 3.0 в эти столбцы не подставляем. Нативная цифра всегда важнее прокси. Балл весов — ползунки (цена входит). Пресет «Код» по умолчанию. Сила и инж. связки: интеллект/логика/поиск решений ~40% (HLE, AA интеллект, LCB), гуру-код парсеров/ботов/сайтов ~35% (DeepSWE, SWE-Pro, AA код, Verified, Design Web), агент и скорость ~25% (AA агент, TB 2.1, tok/s). Пустой тест пропускается, за дырки штраф. ALX-DRACO в связке — наша калибровка под замеры OpenRouter на бенчмарке DRACO (ресерч Perplexity), не прогон 100 задач. Новые модели получают оценку по AA/HLE/Vals и ищутся в топе Fusion.
Пять тестов и источники
Лидерборды по отдельным тестам
Веса:
мин → макс столбца, шаг 0.8% · ★ лучший