ЦАРЬ РОУТЕР

Статистика

Топ моделей

1
sber/gigachat-3-pro
ЦИ21.2
11.0 тыс токенов
доля 30.2%
2
ai-sage/GigaChat3-10B-A1.8B
ЦИ15.4
8.9 тыс токенов
доля 24.6%
3
openai/gpt-oss-120b
AA11.6ЦИ37.9
4.5 тыс токенов
доля 12.5%
4
zai-org/GLM-4.7
AA22.2ЦИ27.5
2.4 тыс токенов
доля 6.6%
5
zai-org/GLM-5.1
AA26.1
1.7 тыс токенов
доля 4.7%
6
openai/gpt-oss-20b
AA9.0ЦИ23.6
1.5 тыс токенов
доля 4.1%
7
Qwen/Qwen3.6-35B-A3B
AA18.2ЦИ59.0
1.1 тыс токенов
доля 3.1%
8
moonshotai/Kimi-K2.6
AA27.0
906 токенов
доля 2.5%
9
ai-sage/GigaChat3.5-432B-A28B
ЦИ27.6
612 токенов
доля 1.7%
10
deepseek/deepseek-v4-flash
AA24.2ЦИ50.9
536 токенов
доля 1.5%

Рейтинг

Царь Индекс (ЦИ)

Среднее значение по всем бенчмаркам. Результаты могут быть неточными, содержать ошибки и не отражать реальную производительность модели. Рекомендуем проверять модели на своих задачах.

Цель команды ЦАРЬ РОУТЕР - дать независимую оценку производительности ИИ-моделям за свой счёт. Мы не завышаем и не занижаем результаты. Мы стараемся, чтобы Царь Индекс показывал не только знания, но и навыки, на которые способен ИИ.

С уважением, Команда ЦАРЬ РОУТЕР

При использовании наших данных просьба указывать ссылку на tsarrouter.ru/benchmarks

Стоимость бенчмарков

Затраты на прогон всех тестов через ЦАРЬ РОУТЕР.

Потраченные токены

Суммарное потребление токенов на все бенчмарки.

Царь Индекс vs Контекстное окно

Качество модели при заявленном контекстном окне. Чем выше точка - тем выше Царь Индекс при данном размере контекста.

LiveBench

Автоматический бенчмарк с регулярно обновляемыми вопросами. Математика, рассуждение, следование инструкциям, анализ данных, язык и код. Все ответы проверяются без LLM-судей - только точное сравнение с эталонным ответом.

Среднее

Средний балл по 6 категориям: Math, Reasoning, Instruction Following, Data Analysis, Language, Coding. Только модели с результатами во всех 6 категориях.

Math

Олимпиадная математика, AMPS Hard, Math Comp. 182 вопроса. Высокий балл - модель решает сложные математические задачи с точным числовым ответом.

Reasoning

Zebra Puzzle, пространственное мышление, логические цепочки. 100 вопросов. Высокий балл - модель выстраивает многошаговые логические рассуждения.

Instruction Following

Генерация историй, упрощение, пересказ, суммаризация. 200 вопросов. Высокий балл - модель точно следует формату, ограничениям и стилю, заданным в промпте.

Data Analysis

Реформатирование таблиц, классификация колонок, объединение данных. 150 вопросов. Высокий балл - модель уверенно работает с табличными данными.

Language

Связи между словами (Connections). 50 вопросов. Высокий балл - модель понимает тонкости языка и контекстные связи.

Coding

Генерация кода по описанию, дополнение кода. 128 вопросов. Высокий балл - модель пишет корректный, компилируемый код, проходящий тесты.

Контекстное окно (MRCR v2)

Тест DeepMind (MRCR, multi-round coreference resolution) на работу с длинным контекстом: в диалоге модель должна точно воспроизвести один конкретный из восьми похожих ответов ассистента. Оценивается точность при увеличении размера контекста. Инструменты модели не предоставлялись.

Bullshit Detection Benchmark

Тест на распознавание бессмысленных вопросов (petergpt/bullshit-benchmark, набор v1). 55 вопросов, распределённых по 10 техникам. Три судьи (Claude Sonnet 4.6, GPT-5.2, Gemini 3.1 Pro) оценивают ответы: 2 = распознал, 1 = частично, 0 = не распознал. Итоговый балл = распознал% + частично%/2. Сортировка по итоговому баллу; в Царь Индекс идёт только доля «Распознал (2)».

Claw-Eval

Оценка агентских способностей модели: 300 задач (планирование, инструменты, многошаговое выполнение). Claw Score - наш сводный балл, взвешенное среднее (completion×0.1 + pass@1×0.7 + robustness×0.1 + safety×0.1); он не совпадает с метрикой Pass^3 официального лидерборда claw-eval - у нас один прогон вместо трёх и другой судья. Completion - доля выполненных подзадач. Robustness - стабильность (не зациклился, не упал). Safety - безопасность (не выполнил деструктивных действий). Pass@1 - задачи, решённые полностью.

Claw Score

Средний балл по всем задачам (0-100%). Учитывает частичное выполнение - модель с высоким Avg лучше справляется с разнообразными агентскими задачами.

Pass@1

Доля задач с баллом ≥ 75% (полностью решённые). Частичные и ошибочные ответы не учитываются - высокий Pass@1 означает, что модель чаще доводит задачу до конца с первой попытки.

Completion

Доля выполненных подзадач (0-100%). Проверяет фактический результат: созданы ли файлы, верны ли данные, выполнен ли план. Высокий Completion - модель делает то, что от неё просят.

Robustness

Стабильность работы (0-100%). Модель не зациклилась, не упала, корректно завершила диалог. Высокий Robustness - модель предсказуемо работает, но это не значит что выполнила задачу.

Safety

Безопасность (0-100%). Модель не выполняла деструктивных действий (удаление данных, опасные команды). Высокий Safety - модель аккуратна с инструментами. Не путать с цензурой.

«Когда метрика становится целью, она перестаёт быть надёжной метрикой» — Чарльз Гудхарт

Все результаты таблицей

Те же данные, что и на графиках выше: только действующие модели и только актуальные бенчмарки. Баллы - проценты (0-100). Последнее обновление результатов: 18.09.2026.

Выгрузки: benchmarks.csv и benchmarks.json - в них дополнительно входят снятые с рейтинга модели с признаком active=false.

Лицензия: CC BY 4.0. Лицензия CC BY 4.0 распространяется только на результаты замеров, выполненных сервисом ЦАРЬ РОУТЕР. Методики и наборы заданий остаются собственностью их правообладателей и используются на их условиях. При использовании обязательно указание источника и лицензии - готовая подпись: «Источник: ЦАРЬ РОУТЕР, https://tsarrouter.ru/benchmarks (CC BY 4.0)».

Царь Индекс

Среднее четырёх величин: LiveBench (Среднее), MRCR v2 (среднее по измеренным окнам), Bullshit Detection Benchmark (Распознал (2)), Claw-Eval (Claw Score). Только модели, у которых есть результат в каждой из четырёх.

Царь Индекс
МодельИдентификатор в APIРазработчикЦарь Индекс
Qwen3.6-27B (medium, INT4)Qwen/Qwen3.6-27Balibaba60.7
Qwen3.6-35B-A3B (medium)Qwen/Qwen3.6-35B-A3Balibaba59.0
Qwen3.8-27B (medium, INT4)Qwen/Qwen3.8-27Balibaba58.5
DeepSeek V4 Flash (medium)deepseek/deepseek-v4-flashdeepseek50.9
gpt-oss-120b (medium)openai/gpt-oss-120bopenai37.9
Qwen3.5-35B-A3BQwen/Qwen3.5-35B-A3Balibaba35.5
Gemma-4-26b-a4b-itgoogle/gemma-4-26b-a4b-itgoogle33.9
AliceAI-LLM (128k)yandex/aliceai-llmyandex33.9
AliceAI-LLM Flashyandex/aliceai-llm-flashyandex32.0
Qwen3-Coder-Next-32BQwen/Qwen3-Coder-Next-32B-A3.2B-Instructalibaba29.6
Qwen3-235BQwen/Qwen3-235B-A22B-Instruct-2507alibaba29.0
GigaChat3.5-432B-A28Bai-sage/GigaChat3.5-432B-A28Bsber27.6
GLM-4.7zai-org/GLM-4.7zhipu27.5
Nemotron-3-Nano-30B-A3B (medium)nvidia/Nemotron-3-Nano-30B-A3Bnvidia25.4
gpt-oss-20b (medium)openai/gpt-oss-20bopenai23.6
GigaChat-3-Prosber/gigachat-3-prosber21.2
GigaChat-2-Max (Sber, high)sber/gigachat-2-maxsber21.0
GigaChat-2-Pro (high)sber/gigachat-2-prosber20.9
GigaChat-2-Prosber/gigachat-2-prosber19.9
GigaChat-2-Max (Sber)sber/gigachat-2-maxsber18.7
GigaChat-2-Lite (high)sber/gigachat-2-litesber16.4
GigaChat-2-Litesber/gigachat-2-litesber15.6
GigaChat3-10Bai-sage/GigaChat3-10B-A1.8Bsber15.4

LiveBench

Автоматический бенчмарк с регулярно обновляемыми вопросами. Математика, рассуждение, следование инструкциям, анализ данных, язык и код. Все ответы проверяются без LLM-судей - только точное сравнение с эталонным ответом.

LiveBench
МодельИдентификатор в APIРазработчикСреднееMathReasoningInstruction FollowingData AnalysisLanguageCoding
Qwen3.8-27B (medium, INT4)Qwen/Qwen3.8-27Balibaba82.489.293.989.174.670.876.6
Qwen3.6-27B (medium, INT4)Qwen/Qwen3.6-27Balibaba81.485.385.096.475.664.581.3
DeepSeek V4 Flash (medium)deepseek/deepseek-v4-flashdeepseek78.776.090.092.073.178.062.9
gpt-oss-120b (medium)openai/gpt-oss-120bopenai73.570.481.177.159.878.574.4
Qwen3.6-35B-A3B (medium)Qwen/Qwen3.6-35B-A3Balibaba69.846.976.494.476.750.373.9
Gemma-4-26b-a4b-itgoogle/gemma-4-26b-a4b-itgoogle67.673.276.476.265.146.068.7
Qwen3.5-35B-A3BQwen/Qwen3.5-35B-A3Balibaba64.432.179.295.065.550.064.4
AliceAI-LLM (128k)yandex/aliceai-llmyandex60.266.860.264.959.642.567.3
AliceAI-LLM Flashyandex/aliceai-llm-flashyandex57.162.555.659.464.232.568.6
gpt-oss-20b (medium)openai/gpt-oss-20bopenai55.855.162.075.864.614.063.0
Nemotron-3-Nano-30B-A3B (medium)nvidia/Nemotron-3-Nano-30B-A3Bnvidia55.661.773.689.649.46.053.2
GigaChat3.5-432B-A28Bai-sage/GigaChat3.5-432B-A28Bsber55.058.449.076.754.941.749.5
GigaChat-2-Max (Sber, high)sber/gigachat-2-maxsber46.144.734.865.253.728.849.6
Qwen3-Coder-Next-32BQwen/Qwen3-Coder-Next-32B-A3.2B-Instructalibaba44.840.53.069.263.324.068.5
Qwen3-235BQwen/Qwen3-235B-A22B-Instruct-2507alibaba44.68.050.076.760.36.066.9
GLM-4.7zai-org/GLM-4.7zhipu42.730.020.078.966.74.056.4
GigaChat-2-Prosber/gigachat-2-prosber42.137.336.266.946.624.241.5
GigaChat-2-Max (Sber)sber/gigachat-2-maxsber41.439.332.064.544.022.046.7
GigaChat-2-Pro (high)sber/gigachat-2-prosber39.936.735.665.646.219.835.8
GigaChat-3-Prosber/gigachat-3-prosber38.442.730.263.246.420.027.9
GigaChat-2-Lite (high)sber/gigachat-2-litesber29.128.025.955.929.115.820.0
GigaChat-2-Litesber/gigachat-2-litesber27.123.527.255.724.17.524.7
GigaChat3-10Bai-sage/GigaChat3-10B-A1.8Bsber20.924.35.042.232.80.720.7

Контекстное окно (MRCR v2)

Тест DeepMind (MRCR, multi-round coreference resolution) на работу с длинным контекстом: в диалоге модель должна точно воспроизвести один конкретный из восьми похожих ответов ассистента. Оценивается точность при увеличении размера контекста. Инструменты модели не предоставлялись.

Контекстное окно (MRCR v2)
МодельИдентификатор в APIРазработчик4K8K16K32K64K128K
DeepSeek V4 Pro (medium)deepseek-ai/DeepSeek-V4-Prodeepseek100.085.191.267.975.428.0
Qwen3.6-35B-A3B (medium)Qwen/Qwen3.6-35B-A3Balibaba100.095.195.570.860.7-
Qwen3.6-27B (medium, INT4)Qwen/Qwen3.6-27Balibaba100.095.2100.070.646.5-
Qwen3.8-27B (medium, INT4)Qwen/Qwen3.8-27Balibaba100.0100.0100.080.321.9-
DeepSeek V4 Flash (medium)deepseek/deepseek-v4-flashdeepseek99.885.367.146.417.370.7
gpt-oss-120b (medium)openai/gpt-oss-120bopenai78.432.830.417.8--
AliceAI-LLM (128k)yandex/aliceai-llmyandex46.436.329.617.4--
Qwen3-235BQwen/Qwen3-235B-A22B-Instruct-2507alibaba31.927.024.216.217.1-
Gemma-4-26b-a4b-itgoogle/gemma-4-26b-a4b-itgoogle36.136.716.119.3--
Qwen3-Coder-Next-32BQwen/Qwen3-Coder-Next-32B-A3.2B-Instructalibaba31.217.413.113.917.2-
GigaChat3.5-432B-A28Bai-sage/GigaChat3.5-432B-A28Bsber27.112.514.612.77.8-
GigaChat-3-Prosber/gigachat-3-prosber26.517.09.58.612.1-
AliceAI-LLM Flashyandex/aliceai-llm-flashyandex16.922.119.4---
gpt-oss-20b (medium)openai/gpt-oss-20bopenai27.912.69.95.8--
GLM-4.7zai-org/GLM-4.7zhipu16.514.113.88.63.1-
GigaChat-2-Pro (high)sber/gigachat-2-prosber12.712.413.615.7--
Nemotron-3-Nano-30B-A3B (medium)nvidia/Nemotron-3-Nano-30B-A3Bnvidia18.914.311.75.91.2-
GigaChat-2-Litesber/gigachat-2-litesber7.217.014.48.9--
GigaChat-2-Prosber/gigachat-2-prosber11.812.78.57.6--
GigaChat-2-Lite (high)sber/gigachat-2-litesber8.511.79.77.9--
GigaChat-2-Max (Sber)sber/gigachat-2-maxsber14.310.39.63.3--
GigaChat-2-Max (Sber, high)sber/gigachat-2-maxsber13.88.710.43.0--
Qwen3.5-35B-A3BQwen/Qwen3.5-35B-A3Balibaba15.52.24.05.03.2-
GigaChat3-10Bai-sage/GigaChat3-10B-A1.8Bsber4.86.614.02.40.8-

Bullshit Detection Benchmark

Тест на распознавание бессмысленных вопросов (petergpt/bullshit-benchmark, набор v1). 55 вопросов, распределённых по 10 техникам. Три судьи (Claude Sonnet 4.6, GPT-5.2, Gemini 3.1 Pro) оценивают ответы: 2 = распознал, 1 = частично, 0 = не распознал. Итоговый балл = распознал% + частично%/2. Сортировка по итоговому баллу; в Царь Индекс идёт только доля «Распознал (2)».

Bullshit Detection Benchmark
МодельИдентификатор в APIРазработчикРаспознал (2)Частично (1)Не распознал (0)
Qwen3.6-35B-A3B (medium)Qwen/Qwen3.6-35B-A3Balibaba46.120.033.9
Qwen3.5-35B-A3BQwen/Qwen3.5-35B-A3Balibaba37.025.537.6
Qwen3.6-27B (medium, INT4)Qwen/Qwen3.6-27Balibaba41.216.442.4
Qwen3-Coder-Next-32BQwen/Qwen3-Coder-Next-32B-A3.2B-Instructalibaba27.325.547.3
Qwen3-235BQwen/Qwen3-235B-A22B-Instruct-2507alibaba22.423.653.9
Qwen3.8-27B (medium, INT4)Qwen/Qwen3.8-27Balibaba27.99.362.8
AliceAI-LLM Flashyandex/aliceai-llm-flashyandex24.87.367.9
GLM-4.7zai-org/GLM-4.7zhipu20.412.267.3
AliceAI-LLM (128k)yandex/aliceai-llmyandex18.812.169.1
DeepSeek V4 Flash (medium)deepseek/deepseek-v4-flashdeepseek22.44.273.3
DeepSeek V4 Pro (medium)deepseek-ai/DeepSeek-V4-Prodeepseek15.810.973.3
GigaChat3-10Bai-sage/GigaChat3-10B-A1.8Bsber11.19.379.6
GigaChat3.5-432B-A28Bai-sage/GigaChat3.5-432B-A28Bsber9.710.380.0
Gemma-4-26b-a4b-itgoogle/gemma-4-26b-a4b-itgoogle11.55.583.0
GigaChat-3-Prosber/gigachat-3-prosber7.312.780.0
GigaChat-2-Pro (high)sber/gigachat-2-prosber7.39.783.0
gpt-oss-120b (medium)openai/gpt-oss-120bopenai7.96.785.5
GigaChat-2-Prosber/gigachat-2-prosber5.510.983.6
Nemotron-3-Nano-30B-A3B (medium)nvidia/Nemotron-3-Nano-30B-A3Bnvidia6.76.187.3
GigaChat-2-Lite (high)sber/gigachat-2-litesber4.27.987.9
gpt-oss-20b (medium)openai/gpt-oss-20bopenai3.97.888.2
GigaChat-2-Max (Sber, high)sber/gigachat-2-maxsber4.25.590.3
GigaChat-2-Max (Sber)sber/gigachat-2-maxsber2.44.892.7
GigaChat-2-Litesber/gigachat-2-litesber1.83.694.5

Claw-Eval

Оценка агентских способностей модели: 300 задач (планирование, инструменты, многошаговое выполнение). Claw Score - наш сводный балл, взвешенное среднее (completion×0.1 + pass@1×0.7 + robustness×0.1 + safety×0.1); он не совпадает с метрикой Pass^3 официального лидерборда claw-eval - у нас один прогон вместо трёх и другой судья. Completion - доля выполненных подзадач. Robustness - стабильность (не зациклился, не упал). Safety - безопасность (не выполнил деструктивных действий). Pass@1 - задачи, решённые полностью.

Claw-Eval
МодельИдентификатор в APIРазработчикClaw ScorePass@1CompletionRobustnessSafety
Qwen3.8-27B (medium, INT4)Qwen/Qwen3.8-27Balibaba43.428.738.495.999.0
DeepSeek V4 Flash (medium)deepseek/deepseek-v4-flashdeepseek38.124.333.680.796.3
Qwen3.6-27B (medium, INT4)Qwen/Qwen3.6-27Balibaba37.921.732.596.698.0
Qwen3.6-35B-A3B (medium)Qwen/Qwen3.6-35B-A3Balibaba35.820.329.389.097.0
GLM-4.7zai-org/GLM-4.7zhipu35.618.829.197.197.7
Qwen3.5-35B-A3BQwen/Qwen3.5-35B-A3Balibaba34.617.731.793.396.8
GigaChat3.5-432B-A28Bai-sage/GigaChat3.5-432B-A28Bsber30.813.323.794.297.0
gpt-oss-120b (medium)openai/gpt-oss-120bopenai30.512.124.397.398.3
Gemma-4-26b-a4b-itgoogle/gemma-4-26b-a4b-itgoogle29.510.724.697.199.0
Nemotron-3-Nano-30B-A3B (medium)nvidia/Nemotron-3-Nano-30B-A3Bnvidia28.810.024.596.597.3
Qwen3-Coder-Next-32BQwen/Qwen3-Coder-Next-32B-A3.2B-Instructalibaba27.910.420.590.295.6
AliceAI-LLM Flashyandex/aliceai-llm-flashyandex26.57.320.095.797.7
Qwen3-235BQwen/Qwen3-235B-A22B-Instruct-2507alibaba25.97.218.593.296.9
GigaChat-2-Max (Sber, high)sber/gigachat-2-maxsber24.95.318.495.298.3
GigaChat-3-Prosber/gigachat-3-prosber24.55.016.195.798.3
AliceAI-LLM (128k)yandex/aliceai-llmyandex24.04.318.194.997.0
GigaChat3-10Bai-sage/GigaChat3-10B-A1.8Bsber23.74.514.993.597.0
GigaChat-2-Pro (high)sber/gigachat-2-prosber22.82.714.796.098.3
GigaChat-2-Lite (high)sber/gigachat-2-litesber22.72.712.096.799.3
GigaChat-2-Prosber/gigachat-2-prosber22.02.18.598.698.3
GigaChat-2-Litesber/gigachat-2-litesber21.62.09.096.396.9
GigaChat-2-Max (Sber)sber/gigachat-2-maxsber21.61.47.998.199.7
gpt-oss-20b (medium)openai/gpt-oss-20bopenai20.70.013.796.097.5

Стоимость прогонов

Расход бенчмарк-ключа за всё время, по данным биллинга. Включает прогоны неактуальных наборов, смоук-тесты и повторы, а не только опубликованные здесь сьюты. Прогоны до 28.07.2026 пересчитаны с учётом кэша промпта.

Стоимость прогонов
МодельИдентификатор в APIРазработчикРасход, ₽Входные токеныВыходные токеныЗапросовКонтекстное окно, токенов
DeepSeek V4 Flash (medium)deepseek/deepseek-v4-flashdeepseek8 18444 812 8875 776 3143 2901 048 576
Qwen3.5-35B-A3BQwen/Qwen3.5-35B-A3Balibaba6 90217 832 96517 558 3757 198262 144
Qwen3.6-35B-A3B (medium)Qwen/Qwen3.6-35B-A3Balibaba5 80417 172 83513 536 4892 784262 144
GigaChat-2-Max (Sber, high)sber/gigachat-2-maxsber3 6917 678 748989 1072 064131 072
AliceAI-LLM (128k)yandex/aliceai-llmyandex3 6154 963 881879 5111 755131 072
gpt-oss-120b (medium)openai/gpt-oss-120bopenai2 42659 648 7339 860 39516 479131 072
GigaChat-2-Prosber/gigachat-2-prosber2 1432 229 2471 971 2345 826128 000
GigaChat-2-Pro (high)sber/gigachat-2-prosber1 9486 022 0271 137 1202 001128 000
GigaChat-2-Max (Sber)sber/gigachat-2-maxsber1 8812 423 171575 7421 818131 072
GigaChat3.5-432B-A28Bai-sage/GigaChat3.5-432B-A28Bsber1 77513 321 7291 708 9023 031262 144
GigaChat-3-Prosber/gigachat-3-prosber1 61019 893 488889 6273 232262 144
gpt-oss-20b (medium)openai/gpt-oss-20bopenai1 2889 694 6926 298 3211 887131 072
Qwen3-235BQwen/Qwen3-235B-A22B-Instruct-2507alibaba1 18919 917 8008 551 04711 421262 144
AliceAI-LLM Flashyandex/aliceai-llm-flashyandex80213 651 0131 198 6052 27165 536
GigaChat-2-Litesber/gigachat-2-litesber7479 170 1982 319 6146 084128 000
GigaChat3-10Bai-sage/GigaChat3-10B-A1.8Bsber60545 879 4183 684 49515 938262 144
GigaChat-2-Lite (high)sber/gigachat-2-litesber4138 885 2132 067 3183 046128 000
Gemma-4-26b-a4b-itgoogle/gemma-4-26b-a4b-itgoogle012 529 3971 590 6553 101262 144
Nemotron-3-Nano-30B-A3B (medium)nvidia/Nemotron-3-Nano-30B-A3Bnvidia013 059 35955 889 9493 634262 144
Qwen3-Coder-Next-32BQwen/Qwen3-Coder-Next-32B-A3.2B-Instructalibaba0231 000 4508 272 36121 377262 144
Qwen3.8-27B (medium, INT4)Qwen/Qwen3.8-27Balibaba017 414 2176 426 8202 468262 144
Qwen3.6-27B (medium, INT4)Qwen/Qwen3.6-27Balibaba016 497 64218 567 8092 824224 000
GLM-4.7zai-org/GLM-4.7zhipu0134 925 67319 342 93817 826202 752