ЦАРЬ РОУТЕР

Статистика

Топ моделей

1
ai-sage/GigaChat3-10B-A1.8B
ЦИ15.4sber
443.4 тыс токенов
-57%
2
openai/gpt-oss-120b
ЦИ31.8openai
253.0 тыс токенов
-35%
3
openai/gpt-oss-20b
ЦИ21.4openai
158.6 тыс токенов
-97%
4
Qwen/Qwen3.5-35B-A3B
ЦИ35.5alibaba
122.1 тыс токенов
-57%
5
deepseek/deepseek-v4-flash
ЦИ50.9deepseek-ai
73.6 тыс токенов
-100%
6
zai-org/GLM-5.2
zhipu
67.6 тыс токенов
-89%
7
nvidia/Nemotron-3-Nano-30B-A3B
nvidia
58.7 тыс токенов
-57%
8
Qwen/Qwen3.6-35B-A3B
ЦИ59.0alibaba
50.1 тыс токенов
-58%
9
moonshotai/Kimi-K2.6
moonshotai
43.2 тыс токенов
-56%
10
sber/gigachat-2-lite
ЦИ16.4sber
42.5 тыс токенов
-100%

Рейтинг

Царь Индекс (ЦИ)

Среднее значение по всем бенчмаркам. Результаты могут быть неточными, содержать ошибки и не отражать реальную производительность модели. Рекомендуем проверять модели на своих задачах.

Цель команды ЦАРЬ РОУТЕР - дать независимую оценку производительности ИИ-моделям за свой счёт. Мы не завышаем и не занижаем результаты. Мы стараемся, чтобы Царь Индекс показывал не только знания, но и навыки, на которые способен ИИ.

С уважением, Команда ЦАРЬ РОУТЕР

При использовании наших данных просьба указывать ссылку на tsarrouter.ru/benchmarks

Стоимость бенчмарков

Затраты на прогон всех тестов через ЦАРЬ РОУТЕР.

Потраченные токены

Суммарное потребление токенов на все бенчмарки.

Царь Индекс vs Контекстное окно

Качество модели при заявленном контекстном окне. Чем выше точка - тем выше Царь Индекс при данном размере контекста.

LiveBench

Автоматический бенчмарк с регулярно обновляемыми вопросами. Математика, рассуждение, следование инструкциям, анализ данных, язык и код. Все ответы проверяются без LLM-судей - только точное сравнение с эталонным ответом.

Среднее

Средний балл по 6 категориям: Math, Reasoning, Instruction Following, Data Analysis, Language, Coding. Только модели с результатами во всех 6 категориях.

Math

Олимпиадная математика, AMPS Hard, Math Comp. 182 вопроса. Высокий балл - модель решает сложные математические задачи с точным числовым ответом.

Reasoning

Zebra Puzzle, пространственное мышление, логические цепочки. 100 вопросов. Высокий балл - модель выстраивает многошаговые логические рассуждения.

Instruction Following

Генерация историй, упрощение, пересказ, суммаризация. 200 вопросов. Высокий балл - модель точно следует формату, ограничениям и стилю, заданным в промпте.

Data Analysis

Реформатирование таблиц, классификация колонок, объединение данных. 150 вопросов. Высокий балл - модель уверенно работает с табличными данными.

Language

Связи между словами (Connections). 50 вопросов. Высокий балл - модель понимает тонкости языка и контекстные связи.

Coding

Генерация кода по описанию, дополнение кода. 128 вопросов. Высокий балл - модель пишет корректный, компилируемый код, проходящий тесты.

Контекстное окно (MRCR v2)

Тест DeepMind (MRCR, multi-round coreference resolution) на работу с длинным контекстом: в диалоге модель должна точно воспроизвести один конкретный из восьми похожих ответов ассистента. Оценивается точность при увеличении размера контекста. Инструменты модели не предоставлялись. Методика: arXiv:2409.12640v2.

Bullshit Detection Benchmark

Тест на распознавание бессмысленных вопросов (petergpt/bullshit-benchmark, набор v1). 55 вопросов, распределённых по 10 техникам. Три судьи (Claude Sonnet 4.6, GPT-5.2, Gemini 3.1 Pro) оценивают ответы: 2 = распознал, 1 = частично, 0 = не распознал. Итоговый балл = распознал% + частично%/2. Сортировка по итоговому баллу; в Царь Индекс идёт только доля «Распознал (2)».

claw-eval (Agent Tasks)

Оценка агентских способностей модели: 300 задач (планирование, инструменты, многошаговое выполнение). Claw Score - наш сводный балл, взвешенное среднее (completion×0.1 + pass@1×0.7 + robustness×0.1 + safety×0.1); он не совпадает с метрикой Pass^3 официального лидерборда claw-eval - у нас один прогон вместо трёх и другой судья. Completion - доля выполненных подзадач. Robustness - стабильность (не зациклился, не упал). Safety - безопасность (не выполнил деструктивных действий). Pass@1 - задачи, решённые полностью.

Claw Score

Средний балл по всем задачам (0-100%). Учитывает частичное выполнение - модель с высоким Avg лучше справляется с разнообразными агентскими задачами.

Pass@1

Доля задач с баллом ≥ 75% (полностью решённые). Частичные и ошибочные ответы не учитываются - высокий Pass@1 означает, что модель чаще доводит задачу до конца с первой попытки.

Completion

Доля выполненных подзадач (0-100%). Проверяет фактический результат: созданы ли файлы, верны ли данные, выполнен ли план. Высокий Completion - модель делает то, что от неё просят.

Robustness

Стабильность работы (0-100%). Модель не зациклилась, не упала, корректно завершила диалог. Высокий Robustness - модель предсказуемо работает, но это не значит что выполнила задачу.

Safety

Безопасность (0-100%). Модель не выполняла деструктивных действий (удаление данных, опасные команды). Высокий Safety - модель аккуратна с инструментами. Не путать с цензурой.

«Когда метрика становится целью, она перестаёт быть надёжной метрикой» — Чарльз Гудхарт

Все результаты таблицей

Те же данные, что и на графиках выше: только действующие модели и только актуальные бенчмарки. Баллы - проценты (0-100). Последнее обновление результатов: 01.08.2026.

Выгрузки: benchmarks.csv и benchmarks.json - в них дополнительно входят снятые с рейтинга модели с признаком active=false.

Лицензия: CC BY 4.0. Лицензия CC BY 4.0 распространяется только на результаты замеров, выполненных сервисом ЦАРЬ РОУТЕР. Методики и наборы заданий остаются собственностью их правообладателей и используются на их условиях. При использовании обязательно указание источника и лицензии - готовая подпись: «Источник: ЦАРЬ РОУТЕР, https://tsarrouter.ru/benchmarks (CC BY 4.0)».

Царь Индекс

Среднее четырёх величин: LiveBench (Среднее), MRCR v2 (среднее по измеренным окнам), Bullshit Detection Benchmark (Распознал (2)), claw-eval (Claw Score). Только модели, у которых есть результат в каждой из четырёх.

Царь Индекс
МодельИдентификатор в APIРазработчикЦарь Индекс
Qwen3.6-35B-A3B (medium)Qwen/Qwen3.6-35B-A3Balibaba59.0
DeepSeek V4 Flash (medium)deepseek/deepseek-v4-flashdeepseek50.9
AliceAI-LLM (128k)yandex/aliceai-llmyandex33.9
AliceAI-LLM Flashyandex/aliceai-llm-flashyandex32.0
gpt-oss-120b (medium)openai/gpt-oss-120bopenai31.8
Qwen3-Coder-Next-32BQwen/Qwen3-Coder-Next-32B-A3.2B-Instructalibaba29.6
Qwen3-235BQwen/Qwen3-235B-A22B-Instruct-2507alibaba29.0
GLM-4.7zai-org/GLM-4.7zhipu27.5
gpt-oss-20b (medium)openai/gpt-oss-20bopenai21.4
GigaChat-2-Pro (high)sber/gigachat-2-prosber20.9
GigaChat-2-Prosber/gigachat-2-prosber19.9
GigaChat Max (Sber)sber/gigachat-2-maxsber18.7
GigaChat-2-Lite (high)sber/gigachat-2-litesber16.4
GigaChat-2-Litesber/gigachat-2-litesber15.6
GigaChat3-10Bai-sage/GigaChat3-10B-A1.8Bsber15.4

LiveBench

Автоматический бенчмарк с регулярно обновляемыми вопросами. Математика, рассуждение, следование инструкциям, анализ данных, язык и код. Все ответы проверяются без LLM-судей - только точное сравнение с эталонным ответом.

LiveBench
МодельИдентификатор в APIРазработчикСреднееMathReasoningInstruction FollowingData AnalysisLanguageCoding
DeepSeek V4 Flash (medium)deepseek/deepseek-v4-flashdeepseek78.776.090.092.073.178.062.9
gpt-oss-120b (medium)openai/gpt-oss-120bopenai73.570.481.177.159.878.574.4
Qwen3.6-35B-A3B (medium)Qwen/Qwen3.6-35B-A3Balibaba69.846.976.494.476.750.373.9
AliceAI-LLM (128k)yandex/aliceai-llmyandex60.266.860.264.959.642.567.3
AliceAI-LLM Flashyandex/aliceai-llm-flashyandex57.162.555.659.464.232.568.6
gpt-oss-20b (medium)openai/gpt-oss-20bopenai55.855.162.075.864.614.063.0
Qwen3-Coder-Next-32BQwen/Qwen3-Coder-Next-32B-A3.2B-Instructalibaba44.840.53.069.263.324.068.5
Qwen3-235BQwen/Qwen3-235B-A22B-Instruct-2507alibaba44.68.050.076.760.36.066.9
GLM-4.7zai-org/GLM-4.7zhipu42.730.020.078.966.74.056.4
GigaChat-2-Prosber/gigachat-2-prosber42.137.336.266.946.624.241.5
GigaChat Max (Sber)sber/gigachat-2-maxsber41.439.332.064.544.022.046.7
GigaChat-2-Pro (high)sber/gigachat-2-prosber39.936.735.665.646.219.835.8
GigaChat-2-Lite (high)sber/gigachat-2-litesber29.128.025.955.929.115.820.0
GigaChat-2-Litesber/gigachat-2-litesber27.123.527.255.724.17.524.7
GigaChat3-10Bai-sage/GigaChat3-10B-A1.8Bsber20.924.35.042.232.80.720.7

Контекстное окно (MRCR v2)

Тест DeepMind (MRCR, multi-round coreference resolution) на работу с длинным контекстом: в диалоге модель должна точно воспроизвести один конкретный из восьми похожих ответов ассистента. Оценивается точность при увеличении размера контекста. Инструменты модели не предоставлялись. Методика: arXiv:2409.12640v2.

Контекстное окно (MRCR v2)
МодельИдентификатор в APIРазработчик4K8K16K32K64K128K
DeepSeek V4 Pro (medium)deepseek-ai/DeepSeek-V4-Prodeepseek100.085.191.267.975.428.0
Qwen3.6-35B-A3B (medium)Qwen/Qwen3.6-35B-A3Balibaba100.095.195.570.860.7-
DeepSeek V4 Flash (medium)deepseek/deepseek-v4-flashdeepseek99.885.367.146.417.370.7
AliceAI-LLM (128k)yandex/aliceai-llmyandex46.436.329.617.4--
Qwen3-235BQwen/Qwen3-235B-A22B-Instruct-2507alibaba31.927.024.216.217.1-
Qwen3-Coder-Next-32BQwen/Qwen3-Coder-Next-32B-A3.2B-Instructalibaba31.217.413.113.917.2-
gpt-oss-120b (medium)openai/gpt-oss-120bopenai49.213.87.42.32.9-
AliceAI-LLM Flashyandex/aliceai-llm-flashyandex16.922.119.4---
GLM-4.7zai-org/GLM-4.7zhipu16.514.113.88.63.1-
GigaChat-2-Pro (high)sber/gigachat-2-prosber12.712.413.615.7--
GigaChat-2-Litesber/gigachat-2-litesber7.217.014.48.9--
GigaChat-2-Prosber/gigachat-2-prosber11.812.78.57.6--
GigaChat-2-Lite (high)sber/gigachat-2-litesber8.511.79.77.9--
GigaChat Max (Sber)sber/gigachat-2-maxsber14.310.39.63.3--
GigaChat3-10Bai-sage/GigaChat3-10B-A1.8Bsber4.86.614.02.40.8-
gpt-oss-20b (medium)openai/gpt-oss-20bopenai11.32.49.41.61.6-

Bullshit Detection Benchmark

Тест на распознавание бессмысленных вопросов (petergpt/bullshit-benchmark, набор v1). 55 вопросов, распределённых по 10 техникам. Три судьи (Claude Sonnet 4.6, GPT-5.2, Gemini 3.1 Pro) оценивают ответы: 2 = распознал, 1 = частично, 0 = не распознал. Итоговый балл = распознал% + частично%/2. Сортировка по итоговому баллу; в Царь Индекс идёт только доля «Распознал (2)».

Bullshit Detection Benchmark
МодельИдентификатор в APIРазработчикРаспознал (2)Частично (1)Не распознал (0)
Qwen3.6-35B-A3B (medium)Qwen/Qwen3.6-35B-A3Balibaba46.120.033.9
Qwen3-Coder-Next-32BQwen/Qwen3-Coder-Next-32B-A3.2B-Instructalibaba27.325.547.3
Qwen3-235BQwen/Qwen3-235B-A22B-Instruct-2507alibaba22.423.653.9
AliceAI-LLM Flashyandex/aliceai-llm-flashyandex24.87.367.9
GLM-4.7zai-org/GLM-4.7zhipu20.412.267.3
AliceAI-LLM (128k)yandex/aliceai-llmyandex18.812.169.1
DeepSeek V4 Flash (medium)deepseek/deepseek-v4-flashdeepseek22.44.273.3
DeepSeek V4 Pro (medium)deepseek-ai/DeepSeek-V4-Prodeepseek15.810.973.3
GigaChat3-10Bai-sage/GigaChat3-10B-A1.8Bsber11.19.379.6
GigaChat-2-Pro (high)sber/gigachat-2-prosber7.39.783.0
gpt-oss-120b (medium)openai/gpt-oss-120bopenai7.96.785.5
GigaChat-2-Prosber/gigachat-2-prosber5.510.983.6
GigaChat-2-Lite (high)sber/gigachat-2-litesber4.27.987.9
gpt-oss-20b (medium)openai/gpt-oss-20bopenai3.97.888.2
GigaChat Max (Sber)sber/gigachat-2-maxsber2.44.892.7
GigaChat-2-Litesber/gigachat-2-litesber1.83.694.5

claw-eval (Agent Tasks)

Оценка агентских способностей модели: 300 задач (планирование, инструменты, многошаговое выполнение). Claw Score - наш сводный балл, взвешенное среднее (completion×0.1 + pass@1×0.7 + robustness×0.1 + safety×0.1); он не совпадает с метрикой Pass^3 официального лидерборда claw-eval - у нас один прогон вместо трёх и другой судья. Completion - доля выполненных подзадач. Robustness - стабильность (не зациклился, не упал). Safety - безопасность (не выполнил деструктивных действий). Pass@1 - задачи, решённые полностью.

claw-eval (Agent Tasks)
МодельИдентификатор в APIРазработчикClaw ScorePass@1CompletionRobustnessSafety
DeepSeek V4 Flash (medium)deepseek/deepseek-v4-flashdeepseek38.124.333.680.796.3
Qwen3.6-35B-A3B (medium)Qwen/Qwen3.6-35B-A3Balibaba35.820.329.389.097.0
GLM-4.7zai-org/GLM-4.7zhipu35.618.829.197.197.7
gpt-oss-120b (medium)openai/gpt-oss-120bopenai30.512.124.397.398.3
Qwen3-Coder-Next-32BQwen/Qwen3-Coder-Next-32B-A3.2B-Instructalibaba27.910.420.590.295.6
AliceAI-LLM Flashyandex/aliceai-llm-flashyandex26.57.320.095.797.7
Qwen3-235BQwen/Qwen3-235B-A22B-Instruct-2507alibaba25.97.218.593.296.9
AliceAI-LLM (128k)yandex/aliceai-llmyandex24.04.318.194.997.0
GigaChat3-10Bai-sage/GigaChat3-10B-A1.8Bsber23.74.514.993.597.0
GigaChat-2-Pro (high)sber/gigachat-2-prosber22.82.714.796.098.3
GigaChat-2-Lite (high)sber/gigachat-2-litesber22.72.712.096.799.3
GigaChat-2-Prosber/gigachat-2-prosber22.02.18.598.698.3
GigaChat-2-Litesber/gigachat-2-litesber21.62.09.096.396.9
GigaChat Max (Sber)sber/gigachat-2-maxsber21.61.47.998.199.7
gpt-oss-20b (medium)openai/gpt-oss-20bopenai20.70.013.796.097.5

Стоимость прогонов

Расход бенчмарк-ключа за всё время, по данным биллинга. Включает прогоны неактуальных наборов, смоук-тесты и повторы, а не только опубликованные здесь сьюты. Прогоны до 28.07.2026 пересчитаны с учётом кэша промпта.

Стоимость прогонов
МодельИдентификатор в APIРазработчикРасход, ₽Входные токеныВыходные токеныЗапросовКонтекстное окно, токенов
DeepSeek V4 Flash (medium)deepseek/deepseek-v4-flashdeepseek8 18444 812 8875 776 3143 2901 048 576
Qwen3.6-35B-A3B (medium)Qwen/Qwen3.6-35B-A3Balibaba5 80417 166 99113 516 0472 742262 144
AliceAI-LLM (128k)yandex/aliceai-llmyandex3 6154 963 881879 5111 755131 072
gpt-oss-120b (medium)openai/gpt-oss-120bopenai2 37557 246 4909 666 13116 386131 072
GigaChat-2-Prosber/gigachat-2-prosber2 1432 229 2471 971 2345 826128 000
GigaChat-2-Pro (high)sber/gigachat-2-prosber1 9486 022 0271 137 1202 001128 000
GigaChat Max (Sber)sber/gigachat-2-maxsber1 8812 423 171575 7421 818131 072
gpt-oss-20b (medium)openai/gpt-oss-20bopenai1 2887 275 8585 600 5631 770131 072
Qwen3-235BQwen/Qwen3-235B-A22B-Instruct-2507alibaba1 18919 917 7738 551 02711 418256 000
GigaChat-2-Litesber/gigachat-2-litesber7479 170 1982 319 6146 084128 000
GigaChat3-10Bai-sage/GigaChat3-10B-A1.8Bsber60545 879 4183 684 49515 938262 144
AliceAI-LLM Flashyandex/aliceai-llm-flashyandex5134 475 8441 142 7891 99465 536
GigaChat-2-Lite (high)sber/gigachat-2-litesber4138 885 2132 067 3183 046128 000
Qwen3-Coder-Next-32BQwen/Qwen3-Coder-Next-32B-A3.2B-Instructalibaba0231 000 4508 272 36121 377262 144
GLM-4.7zai-org/GLM-4.7zhipu0134 925 67319 342 93817 826202 752