Статистика
Топ моделей
Рейтинг
Царь Индекс (ЦИ)
Среднее значение по всем бенчмаркам. Результаты могут быть неточными, содержать ошибки и не отражать реальную производительность модели. Рекомендуем проверять модели на своих задачах.
Цель команды ЦАРЬ РОУТЕР - дать независимую оценку производительности ИИ-моделям за свой счёт. Мы не завышаем и не занижаем результаты. Мы стараемся, чтобы Царь Индекс показывал не только знания, но и навыки, на которые способен ИИ.
С уважением, Команда ЦАРЬ РОУТЕР
При использовании наших данных просьба указывать ссылку на tsarrouter.ru/benchmarks
Стоимость бенчмарков
Затраты на прогон всех тестов через ЦАРЬ РОУТЕР.
Потраченные токены
Суммарное потребление токенов на все бенчмарки.
Царь Индекс vs Контекстное окно
Качество модели при заявленном контекстном окне. Чем выше точка - тем выше Царь Индекс при данном размере контекста.
LiveBench
Автоматический бенчмарк с регулярно обновляемыми вопросами. Математика, рассуждение, следование инструкциям, анализ данных, язык и код. Все ответы проверяются без LLM-судей - только точное сравнение с эталонным ответом.
Контекстное окно (MRCR v2)
Тест DeepMind (MRCR, multi-round coreference resolution) на работу с длинным контекстом: в диалоге модель должна точно воспроизвести один конкретный из восьми похожих ответов ассистента. Оценивается точность при увеличении размера контекста. Инструменты модели не предоставлялись. Методика: arXiv:2409.12640v2.
Bullshit Detection Benchmark
Тест на распознавание бессмысленных вопросов (petergpt/bullshit-benchmark, набор v1). 55 вопросов, распределённых по 10 техникам. Три судьи (Claude Sonnet 4.6, GPT-5.2, Gemini 3.1 Pro) оценивают ответы: 2 = распознал, 1 = частично, 0 = не распознал. Итоговый балл = распознал% + частично%/2. Сортировка по итоговому баллу; в Царь Индекс идёт только доля «Распознал (2)».
claw-eval (Agent Tasks)
Оценка агентских способностей модели: 300 задач (планирование, инструменты, многошаговое выполнение). Claw Score - наш сводный балл, взвешенное среднее (completion×0.1 + pass@1×0.7 + robustness×0.1 + safety×0.1); он не совпадает с метрикой Pass^3 официального лидерборда claw-eval - у нас один прогон вместо трёх и другой судья. Completion - доля выполненных подзадач. Robustness - стабильность (не зациклился, не упал). Safety - безопасность (не выполнил деструктивных действий). Pass@1 - задачи, решённые полностью.
«Когда метрика становится целью, она перестаёт быть надёжной метрикой» — Чарльз Гудхарт
Все результаты таблицей
Те же данные, что и на графиках выше: только действующие модели и только актуальные бенчмарки. Баллы - проценты (0-100). Последнее обновление результатов: 01.08.2026.
Выгрузки: benchmarks.csv и benchmarks.json - в них дополнительно входят снятые с рейтинга модели с признаком active=false.
Лицензия: CC BY 4.0. Лицензия CC BY 4.0 распространяется только на результаты замеров, выполненных сервисом ЦАРЬ РОУТЕР. Методики и наборы заданий остаются собственностью их правообладателей и используются на их условиях. При использовании обязательно указание источника и лицензии - готовая подпись: «Источник: ЦАРЬ РОУТЕР, https://tsarrouter.ru/benchmarks (CC BY 4.0)».
Царь Индекс
Среднее четырёх величин: LiveBench (Среднее), MRCR v2 (среднее по измеренным окнам), Bullshit Detection Benchmark (Распознал (2)), claw-eval (Claw Score). Только модели, у которых есть результат в каждой из четырёх.
| Модель | Идентификатор в API | Разработчик | Царь Индекс |
|---|---|---|---|
| Qwen3.6-35B-A3B (medium) | Qwen/Qwen3.6-35B-A3B | alibaba | 59.0 |
| DeepSeek V4 Flash (medium) | deepseek/deepseek-v4-flash | deepseek | 50.9 |
| AliceAI-LLM (128k) | yandex/aliceai-llm | yandex | 33.9 |
| AliceAI-LLM Flash | yandex/aliceai-llm-flash | yandex | 32.0 |
| gpt-oss-120b (medium) | openai/gpt-oss-120b | openai | 31.8 |
| Qwen3-Coder-Next-32B | Qwen/Qwen3-Coder-Next-32B-A3.2B-Instruct | alibaba | 29.6 |
| Qwen3-235B | Qwen/Qwen3-235B-A22B-Instruct-2507 | alibaba | 29.0 |
| GLM-4.7 | zai-org/GLM-4.7 | zhipu | 27.5 |
| gpt-oss-20b (medium) | openai/gpt-oss-20b | openai | 21.4 |
| GigaChat-2-Pro (high) | sber/gigachat-2-pro | sber | 20.9 |
| GigaChat-2-Pro | sber/gigachat-2-pro | sber | 19.9 |
| GigaChat Max (Sber) | sber/gigachat-2-max | sber | 18.7 |
| GigaChat-2-Lite (high) | sber/gigachat-2-lite | sber | 16.4 |
| GigaChat-2-Lite | sber/gigachat-2-lite | sber | 15.6 |
| GigaChat3-10B | ai-sage/GigaChat3-10B-A1.8B | sber | 15.4 |
LiveBench
Автоматический бенчмарк с регулярно обновляемыми вопросами. Математика, рассуждение, следование инструкциям, анализ данных, язык и код. Все ответы проверяются без LLM-судей - только точное сравнение с эталонным ответом.
| Модель | Идентификатор в API | Разработчик | Среднее | Math | Reasoning | Instruction Following | Data Analysis | Language | Coding |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash (medium) | deepseek/deepseek-v4-flash | deepseek | 78.7 | 76.0 | 90.0 | 92.0 | 73.1 | 78.0 | 62.9 |
| gpt-oss-120b (medium) | openai/gpt-oss-120b | openai | 73.5 | 70.4 | 81.1 | 77.1 | 59.8 | 78.5 | 74.4 |
| Qwen3.6-35B-A3B (medium) | Qwen/Qwen3.6-35B-A3B | alibaba | 69.8 | 46.9 | 76.4 | 94.4 | 76.7 | 50.3 | 73.9 |
| AliceAI-LLM (128k) | yandex/aliceai-llm | yandex | 60.2 | 66.8 | 60.2 | 64.9 | 59.6 | 42.5 | 67.3 |
| AliceAI-LLM Flash | yandex/aliceai-llm-flash | yandex | 57.1 | 62.5 | 55.6 | 59.4 | 64.2 | 32.5 | 68.6 |
| gpt-oss-20b (medium) | openai/gpt-oss-20b | openai | 55.8 | 55.1 | 62.0 | 75.8 | 64.6 | 14.0 | 63.0 |
| Qwen3-Coder-Next-32B | Qwen/Qwen3-Coder-Next-32B-A3.2B-Instruct | alibaba | 44.8 | 40.5 | 3.0 | 69.2 | 63.3 | 24.0 | 68.5 |
| Qwen3-235B | Qwen/Qwen3-235B-A22B-Instruct-2507 | alibaba | 44.6 | 8.0 | 50.0 | 76.7 | 60.3 | 6.0 | 66.9 |
| GLM-4.7 | zai-org/GLM-4.7 | zhipu | 42.7 | 30.0 | 20.0 | 78.9 | 66.7 | 4.0 | 56.4 |
| GigaChat-2-Pro | sber/gigachat-2-pro | sber | 42.1 | 37.3 | 36.2 | 66.9 | 46.6 | 24.2 | 41.5 |
| GigaChat Max (Sber) | sber/gigachat-2-max | sber | 41.4 | 39.3 | 32.0 | 64.5 | 44.0 | 22.0 | 46.7 |
| GigaChat-2-Pro (high) | sber/gigachat-2-pro | sber | 39.9 | 36.7 | 35.6 | 65.6 | 46.2 | 19.8 | 35.8 |
| GigaChat-2-Lite (high) | sber/gigachat-2-lite | sber | 29.1 | 28.0 | 25.9 | 55.9 | 29.1 | 15.8 | 20.0 |
| GigaChat-2-Lite | sber/gigachat-2-lite | sber | 27.1 | 23.5 | 27.2 | 55.7 | 24.1 | 7.5 | 24.7 |
| GigaChat3-10B | ai-sage/GigaChat3-10B-A1.8B | sber | 20.9 | 24.3 | 5.0 | 42.2 | 32.8 | 0.7 | 20.7 |
Контекстное окно (MRCR v2)
Тест DeepMind (MRCR, multi-round coreference resolution) на работу с длинным контекстом: в диалоге модель должна точно воспроизвести один конкретный из восьми похожих ответов ассистента. Оценивается точность при увеличении размера контекста. Инструменты модели не предоставлялись. Методика: arXiv:2409.12640v2.
| Модель | Идентификатор в API | Разработчик | 4K | 8K | 16K | 32K | 64K | 128K |
|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro (medium) | deepseek-ai/DeepSeek-V4-Pro | deepseek | 100.0 | 85.1 | 91.2 | 67.9 | 75.4 | 28.0 |
| Qwen3.6-35B-A3B (medium) | Qwen/Qwen3.6-35B-A3B | alibaba | 100.0 | 95.1 | 95.5 | 70.8 | 60.7 | - |
| DeepSeek V4 Flash (medium) | deepseek/deepseek-v4-flash | deepseek | 99.8 | 85.3 | 67.1 | 46.4 | 17.3 | 70.7 |
| AliceAI-LLM (128k) | yandex/aliceai-llm | yandex | 46.4 | 36.3 | 29.6 | 17.4 | - | - |
| Qwen3-235B | Qwen/Qwen3-235B-A22B-Instruct-2507 | alibaba | 31.9 | 27.0 | 24.2 | 16.2 | 17.1 | - |
| Qwen3-Coder-Next-32B | Qwen/Qwen3-Coder-Next-32B-A3.2B-Instruct | alibaba | 31.2 | 17.4 | 13.1 | 13.9 | 17.2 | - |
| gpt-oss-120b (medium) | openai/gpt-oss-120b | openai | 49.2 | 13.8 | 7.4 | 2.3 | 2.9 | - |
| AliceAI-LLM Flash | yandex/aliceai-llm-flash | yandex | 16.9 | 22.1 | 19.4 | - | - | - |
| GLM-4.7 | zai-org/GLM-4.7 | zhipu | 16.5 | 14.1 | 13.8 | 8.6 | 3.1 | - |
| GigaChat-2-Pro (high) | sber/gigachat-2-pro | sber | 12.7 | 12.4 | 13.6 | 15.7 | - | - |
| GigaChat-2-Lite | sber/gigachat-2-lite | sber | 7.2 | 17.0 | 14.4 | 8.9 | - | - |
| GigaChat-2-Pro | sber/gigachat-2-pro | sber | 11.8 | 12.7 | 8.5 | 7.6 | - | - |
| GigaChat-2-Lite (high) | sber/gigachat-2-lite | sber | 8.5 | 11.7 | 9.7 | 7.9 | - | - |
| GigaChat Max (Sber) | sber/gigachat-2-max | sber | 14.3 | 10.3 | 9.6 | 3.3 | - | - |
| GigaChat3-10B | ai-sage/GigaChat3-10B-A1.8B | sber | 4.8 | 6.6 | 14.0 | 2.4 | 0.8 | - |
| gpt-oss-20b (medium) | openai/gpt-oss-20b | openai | 11.3 | 2.4 | 9.4 | 1.6 | 1.6 | - |
Bullshit Detection Benchmark
Тест на распознавание бессмысленных вопросов (petergpt/bullshit-benchmark, набор v1). 55 вопросов, распределённых по 10 техникам. Три судьи (Claude Sonnet 4.6, GPT-5.2, Gemini 3.1 Pro) оценивают ответы: 2 = распознал, 1 = частично, 0 = не распознал. Итоговый балл = распознал% + частично%/2. Сортировка по итоговому баллу; в Царь Индекс идёт только доля «Распознал (2)».
| Модель | Идентификатор в API | Разработчик | Распознал (2) | Частично (1) | Не распознал (0) |
|---|---|---|---|---|---|
| Qwen3.6-35B-A3B (medium) | Qwen/Qwen3.6-35B-A3B | alibaba | 46.1 | 20.0 | 33.9 |
| Qwen3-Coder-Next-32B | Qwen/Qwen3-Coder-Next-32B-A3.2B-Instruct | alibaba | 27.3 | 25.5 | 47.3 |
| Qwen3-235B | Qwen/Qwen3-235B-A22B-Instruct-2507 | alibaba | 22.4 | 23.6 | 53.9 |
| AliceAI-LLM Flash | yandex/aliceai-llm-flash | yandex | 24.8 | 7.3 | 67.9 |
| GLM-4.7 | zai-org/GLM-4.7 | zhipu | 20.4 | 12.2 | 67.3 |
| AliceAI-LLM (128k) | yandex/aliceai-llm | yandex | 18.8 | 12.1 | 69.1 |
| DeepSeek V4 Flash (medium) | deepseek/deepseek-v4-flash | deepseek | 22.4 | 4.2 | 73.3 |
| DeepSeek V4 Pro (medium) | deepseek-ai/DeepSeek-V4-Pro | deepseek | 15.8 | 10.9 | 73.3 |
| GigaChat3-10B | ai-sage/GigaChat3-10B-A1.8B | sber | 11.1 | 9.3 | 79.6 |
| GigaChat-2-Pro (high) | sber/gigachat-2-pro | sber | 7.3 | 9.7 | 83.0 |
| gpt-oss-120b (medium) | openai/gpt-oss-120b | openai | 7.9 | 6.7 | 85.5 |
| GigaChat-2-Pro | sber/gigachat-2-pro | sber | 5.5 | 10.9 | 83.6 |
| GigaChat-2-Lite (high) | sber/gigachat-2-lite | sber | 4.2 | 7.9 | 87.9 |
| gpt-oss-20b (medium) | openai/gpt-oss-20b | openai | 3.9 | 7.8 | 88.2 |
| GigaChat Max (Sber) | sber/gigachat-2-max | sber | 2.4 | 4.8 | 92.7 |
| GigaChat-2-Lite | sber/gigachat-2-lite | sber | 1.8 | 3.6 | 94.5 |
claw-eval (Agent Tasks)
Оценка агентских способностей модели: 300 задач (планирование, инструменты, многошаговое выполнение). Claw Score - наш сводный балл, взвешенное среднее (completion×0.1 + pass@1×0.7 + robustness×0.1 + safety×0.1); он не совпадает с метрикой Pass^3 официального лидерборда claw-eval - у нас один прогон вместо трёх и другой судья. Completion - доля выполненных подзадач. Robustness - стабильность (не зациклился, не упал). Safety - безопасность (не выполнил деструктивных действий). Pass@1 - задачи, решённые полностью.
| Модель | Идентификатор в API | Разработчик | Claw Score | Pass@1 | Completion | Robustness | Safety |
|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash (medium) | deepseek/deepseek-v4-flash | deepseek | 38.1 | 24.3 | 33.6 | 80.7 | 96.3 |
| Qwen3.6-35B-A3B (medium) | Qwen/Qwen3.6-35B-A3B | alibaba | 35.8 | 20.3 | 29.3 | 89.0 | 97.0 |
| GLM-4.7 | zai-org/GLM-4.7 | zhipu | 35.6 | 18.8 | 29.1 | 97.1 | 97.7 |
| gpt-oss-120b (medium) | openai/gpt-oss-120b | openai | 30.5 | 12.1 | 24.3 | 97.3 | 98.3 |
| Qwen3-Coder-Next-32B | Qwen/Qwen3-Coder-Next-32B-A3.2B-Instruct | alibaba | 27.9 | 10.4 | 20.5 | 90.2 | 95.6 |
| AliceAI-LLM Flash | yandex/aliceai-llm-flash | yandex | 26.5 | 7.3 | 20.0 | 95.7 | 97.7 |
| Qwen3-235B | Qwen/Qwen3-235B-A22B-Instruct-2507 | alibaba | 25.9 | 7.2 | 18.5 | 93.2 | 96.9 |
| AliceAI-LLM (128k) | yandex/aliceai-llm | yandex | 24.0 | 4.3 | 18.1 | 94.9 | 97.0 |
| GigaChat3-10B | ai-sage/GigaChat3-10B-A1.8B | sber | 23.7 | 4.5 | 14.9 | 93.5 | 97.0 |
| GigaChat-2-Pro (high) | sber/gigachat-2-pro | sber | 22.8 | 2.7 | 14.7 | 96.0 | 98.3 |
| GigaChat-2-Lite (high) | sber/gigachat-2-lite | sber | 22.7 | 2.7 | 12.0 | 96.7 | 99.3 |
| GigaChat-2-Pro | sber/gigachat-2-pro | sber | 22.0 | 2.1 | 8.5 | 98.6 | 98.3 |
| GigaChat-2-Lite | sber/gigachat-2-lite | sber | 21.6 | 2.0 | 9.0 | 96.3 | 96.9 |
| GigaChat Max (Sber) | sber/gigachat-2-max | sber | 21.6 | 1.4 | 7.9 | 98.1 | 99.7 |
| gpt-oss-20b (medium) | openai/gpt-oss-20b | openai | 20.7 | 0.0 | 13.7 | 96.0 | 97.5 |
Стоимость прогонов
Расход бенчмарк-ключа за всё время, по данным биллинга. Включает прогоны неактуальных наборов, смоук-тесты и повторы, а не только опубликованные здесь сьюты. Прогоны до 28.07.2026 пересчитаны с учётом кэша промпта.
| Модель | Идентификатор в API | Разработчик | Расход, ₽ | Входные токены | Выходные токены | Запросов | Контекстное окно, токенов |
|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash (medium) | deepseek/deepseek-v4-flash | deepseek | 8 184 | 44 812 887 | 5 776 314 | 3 290 | 1 048 576 |
| Qwen3.6-35B-A3B (medium) | Qwen/Qwen3.6-35B-A3B | alibaba | 5 804 | 17 166 991 | 13 516 047 | 2 742 | 262 144 |
| AliceAI-LLM (128k) | yandex/aliceai-llm | yandex | 3 615 | 4 963 881 | 879 511 | 1 755 | 131 072 |
| gpt-oss-120b (medium) | openai/gpt-oss-120b | openai | 2 375 | 57 246 490 | 9 666 131 | 16 386 | 131 072 |
| GigaChat-2-Pro | sber/gigachat-2-pro | sber | 2 143 | 2 229 247 | 1 971 234 | 5 826 | 128 000 |
| GigaChat-2-Pro (high) | sber/gigachat-2-pro | sber | 1 948 | 6 022 027 | 1 137 120 | 2 001 | 128 000 |
| GigaChat Max (Sber) | sber/gigachat-2-max | sber | 1 881 | 2 423 171 | 575 742 | 1 818 | 131 072 |
| gpt-oss-20b (medium) | openai/gpt-oss-20b | openai | 1 288 | 7 275 858 | 5 600 563 | 1 770 | 131 072 |
| Qwen3-235B | Qwen/Qwen3-235B-A22B-Instruct-2507 | alibaba | 1 189 | 19 917 773 | 8 551 027 | 11 418 | 256 000 |
| GigaChat-2-Lite | sber/gigachat-2-lite | sber | 747 | 9 170 198 | 2 319 614 | 6 084 | 128 000 |
| GigaChat3-10B | ai-sage/GigaChat3-10B-A1.8B | sber | 605 | 45 879 418 | 3 684 495 | 15 938 | 262 144 |
| AliceAI-LLM Flash | yandex/aliceai-llm-flash | yandex | 513 | 4 475 844 | 1 142 789 | 1 994 | 65 536 |
| GigaChat-2-Lite (high) | sber/gigachat-2-lite | sber | 413 | 8 885 213 | 2 067 318 | 3 046 | 128 000 |
| Qwen3-Coder-Next-32B | Qwen/Qwen3-Coder-Next-32B-A3.2B-Instruct | alibaba | 0 | 231 000 450 | 8 272 361 | 21 377 | 262 144 |
| GLM-4.7 | zai-org/GLM-4.7 | zhipu | 0 | 134 925 673 | 19 342 938 | 17 826 | 202 752 |