Лучшая русская нейросеть выбирается здесь по замерам, где русский язык меряется отдельно от английского. Слепые голоса людей на русских запросах, экзаменационные задания на русском, олимпиадная математика по-русски и российская арена, в которой зарубежные и российские модели стоят в одной таблице, — четыре зачёта, и у каждого числа ниже стоит имя источника и дата снимка — день, когда числа сняли со страницы зачёта. Рейтинги живые, поэтому дата — часть факта.
Слепой голос устроен так: человеку показывают два ответа на его же вопрос и не говорят, какая модель что написала, а он выбирает тот, который больше подходит. Сотни тысяч таких выборов пересчитываются в одно число на модель — это и есть её рейтинг Elo, названный по шахматной шкале: чем число больше, тем чаще выбирают ответы этой модели. Второе число рядом, доверительный интервал, показывает пределы, в которых рейтинг может гулять вверх и вниз, и чем эти пределы уже, тем точнее известно место модели. Русский срез такой арены — отдельный подсчёт по тем голосам, где человек писал свой вопрос по-русски.
Дальше идёт разбор по работам: повседневный разговор, рассуждение, длинный текст, код, творческие задачи. Там же — российские сервисы, которые ищут по этому запросу: ГигаЧат, Алиса, Шедеврум и Kandinsky. И цены за русский текст в рублях, за миллион токенов: токены — куски слов, которыми модели считают объём работы, и счёт идёт отдельно за отправленный текст и отдельно за полученный ответ.
Первые строки русского зачёта — Claude Fable 5, Gemini 3.6 Flash и GPT-5.6 — отвечают по-русски в чате ниже на странице, вход для этого не нужен.
Коротко: какая нейросеть лучше всех понимает русский
Верх свежего зачёта по русскому языку занимает Claude Fable 5. В категории Russian на Arena у неё 1519 очков при доверительном интервале ±12 и 2 547 голосах — первая строка таблицы (Arena, Text Arena, срез Russian, снимок 27 августа 2026 года). Рядом стоят Gemini 3.7 Flash в режиме high с 1517 ±24 и пометкой источника «предварительно» и Muse Spark 1.2 в режиме xHigh с 1512 ±32. Дальше идут две модели Anthropic с одинаковой оценкой 1507: Claude Opus 4.7 в режиме high и Claude Opus 4.6.
Рассуждение по-русски меряет отдельный живой зачёт, MERA Reason. Там первая строка — Claude Opus 4.8 с общим баллом 80,82 из ста, вторая — gemma-4-31B-it с 73,94, третья — Qwen3.5-122B-A10B с 67,36 (MERA Reason, обновление 30 июля 2026 года).
Экзаменационный зачёт MERA даёт третий порядок. В его таблице первая строка — Claude-Opus-4.6 с общим баллом 0,862 по шкале от нуля до единицы, вторая — замер живого человека с 0,852, третья — GPT-5.4 с 0,821. Числа сняты из копии страницы в веб-архиве от 11 апреля 2026 года: сам сайт MERA на момент подготовки страницы отдаёт сообщение о технических работах.
Российские модели померены одной меркой с зарубежными на llmarena.ru. Выше всех российских там стоит Alice AI LLM от Яндекса — 1083 очка и ранг 11, следом T-pro-it-2.0 от Т-Банка с 1036, GigaChat 2 Max от Сбера с 999 и YandexGPT 5.1 Pro с 997. Таблица пересчитана 18 апреля 2026 года, и её числа описывают апрельскую картину.
Четыре зачёта дают четыре разные верхние строки, и это не противоречие: они меряют разную работу и собраны на разных составах участников. Складывать места из разных таблиц в один список нельзя — сравнивать числа можно только внутри одной. Дальше каждый зачёт разобран отдельно, с методикой и таблицами.
Устройство замеров: какой индекс говорит о русском языке
Сводный индекс Artificial Analysis, на который чаще всего ссылаются подборки моделей, собран на англоязычных текстовых заданиях — это сказано на странице методики самого источника. Многоязычность там меряется отдельным набором, Artificial Analysis Multilingual Index на основе Global-MMLU-Lite — это экзаменационные вопросы с выбором ответа, переведённые на разные языки, примерно 400 вопросов на язык. Список языков этого набора такой: английский, китайский, хинди, испанский, французский, арабский, бенгальский, португальский, индонезийский, японский, суахили, немецкий, корейский, итальянский, йоруба, бирманский. Русский язык меряют другие зачёты, и они разобраны ниже.
Отсюда правило чтения любой подборки: число из сводного индекса описывает работу модели на англоязычных заданиях, а про русский язык говорят таблицы, собранные на русском материале.
Таких таблиц с числами 2026 года четыре, и вот они рядом.
| Зачёт | Что меряет | Дата данных | Кто ведёт |
|---|---|---|---|
| Arena, Text Arena, срез Russian | слепые парные голоса живых людей на русских запросах | снимок 27 августа 2026 | Arena Intelligence |
| MERA Reason | рассуждение и олимпиадная математика на русском, 4 набора заданий | обновление 30 июля 2026 | Альянс в сфере ИИ |
| MERA, основной зачёт по тексту | 15 закрытых задач на русском: знания, логика, математика, код, ЕГЭ | снимок из веб-архива 11 апреля 2026 | Альянс в сфере ИИ |
| LLM Arena, llmarena.ru | слепые парные голоса на русском, российские и зарубежные модели в одной таблице | пересчёт 18 апреля 2026 | проект llmarena.ru |
Остальные семь найденных замеров русского языка собраны в 2024 и 2025 годах. Они разобраны ниже отдельным разделом как история вопроса: их таблицы описывают модели своего времени.
Лучшая нейросеть онлайн на русском: слепые голоса живых людей
Arena устроена как слепое парное голосование. Посетитель пишет свой запрос, получает ответы двух моделей без названий и выбирает тот, который ему больше подходит; названия раскрываются после голоса. Категория Russian — это те же живые запросы, отобранные по языку: набором заданий здесь служит сам поток вопросов, с которыми люди приходят.
Снимок от 27 августа 2026 года: 359 моделей и 804 885 голосов по русскому языку. Числа сняты чтением таблицы русской категории. Число голосов на странице замерено двумя способами и разошлось: рядом с датой стоит 804 885, а сумма по строкам во внутренних данных страницы даёт 1 170 032. Здесь используется то, что печатает сама страница; построчные числа в обоих способах совпали до единицы.
О надёжности числа в этой таблице говорят две колонки. «Разброс места» — диапазон мест, в котором модель может стоять с учётом неопределённости. Соседняя колонка — сам рейтинг и его доверительный интервал.
| Место | Разброс места | Модель | Разработчик | Оценка ± 95 % ДИ | Голосов |
|---|---|---|---|---|---|
| 1 | 1–10 | claude-fable-5 | Anthropic | 1519 ±12 | 2 547 |
| 2 | 1–26 | gemini-3.7-flash-high | 1517 ±24, предварительно | 616 | |
| 3 | 1–42 | muse-spark-1.2 (xHigh) | Meta | 1512 ±32 | 329 |
| 4 | 1–21 | claude-opus-4-7-high | Anthropic | 1507 ±9 | 6 055 |
| 5 | 1–21 | claude-opus-4-6 | Anthropic | 1507 ±7 | 8 227 |
| 6 | 1–22 | claude-opus-4-6-high | Anthropic | 1506 ±8 | 7 792 |
| 7 | 1–26 | gemini-3-pro | 1501 ±9 | 4 791 | |
| 8 | 1–31 | claude-opus-5-high | Anthropic | 1500 ±11 | 3 392 |
| 9 | 2–26 | gemini-3.1-pro-preview | 1499 ±7 | 10 833 | |
| 10 | 2–29 | claude-opus-4-7 | Anthropic | 1498 ±9 | 6 219 |
| 11 | 2–36 | claude-opus-4-8-high | Anthropic | 1495 ±9 | 4 856 |
| 12 | 1–45 | claude-opus-5-max | Anthropic | 1493 ±15 | 1 604 |
| 13 | 2–42 | gpt-5.6-sol-xhigh | OpenAI | 1492 ±13 | 2 233 |
| 14 | 2–42 | muse-spark-1.1 | Meta | 1492 ±13 | 2 339 |
| 15 | 2–42 | gemini-3.5-flash-high | 1491 ±11 | 3 327 | |
| 16 | 2–42 | gemini-3.5-flash-medium | 1491 ±11 | 3 183 | |
| 17 | 4–38 | gpt-5.4-high | OpenAI | 1490 ±8 | 6 507 |
| 18 | 2–50 | kimi-k3-max | Moonshot | 1488 ±14 | 1 783 |
| 19 | 2–49 | gemini-3.6-flash-high | 1487 ±13 | 2 088 | |
| 20 | 5–45 | gemini-3-flash | 1486 ±10 | 3 913 | |
| 21 | 5–45 | claude-opus-4-8 | Anthropic | 1486 ±9 | 4 748 |
| 22 | 2–52 | qwen3.8-max | Alibaba | 1485 ±16 | 1 361 |
| 23 | 1–79 | qwen3.7-max-preview | Alibaba | 1485 ±32 | 374 |
| 24 | 8–45 | gpt-5.5-high | OpenAI | 1484 ±8 | 6 274 |
| 25 | 5–57 | muse-spark | Meta | 1482 ±16 | 1 464 |
Колонка «Разброс места» — самое полезное, что есть в этой таблице, и читать её нужно раньше, чем места. Она показывает, в каком диапазоне мест модель может находиться с учётом неопределённости. У первой строки это 1–10, у второй 1–26, у третьей 1–42. То есть верхняя десятка здесь — не порядок от первого к десятому, а группа моделей, между которыми зачёт разницы не проводит.
Причина широких интервалов названа прямо: голосов по русскому в десять раз меньше, чем в общем зачёте. У верхних строк русского среза интервал составляет от ±7 до ±32, тогда как в общем зачёте — от ±3 до ±5. У строк, набравших несколько сотен голосов, разница между соседними местами внутри интервала неразличима: Gemini 3.7 Flash в режиме high стоит вторым при 616 голосах, Muse Spark 1.2 — третьим при 329, и обе строки источник помечает как предварительные или снабжает широким интервалом.
Практический вывод из таблицы такой. Верх русского зачёта занят семейством Claude: восемь строк из первых двенадцати. Рядом с ними стоят Gemini разных версий — семь строк в первой двадцатке. Дальше идут GPT-5.6 Sol, GPT-5.4, Kimi K3 и Qwen. Голосуют за эти ответы живые люди, задававшие свои вопросы по-русски, поэтому зачёт отражает именно повседневную переписку, а не экзаменационные задания.
Модели каталога GEN202 в русском срезе
Модели каталога GEN202 стоят в той же таблице. Ниже их строки из того же снимка от 27 августа 2026 года — те, что попали в верхние сорок мест русского среза.
| Модель в каталоге | Строка зачёта | Место в русском срезе | Оценка ± ДИ | Голосов |
|---|---|---|---|---|
| Claude Fable 5 | claude-fable-5 | 1 | 1519 ±12 | 2 547 |
| Claude Opus 5 | claude-opus-5-high | 8 | 1500 ±11 | 3 392 |
| Claude Opus 5 | claude-opus-5-max | 12 | 1493 ±15 | 1 604 |
| GPT-5.6 Sol | gpt-5.6-sol-xhigh | 13 | 1492 ±13 | 2 233 |
| Gemini 3.6 Flash | gemini-3.6-flash-high | 19 | 1487 ±13 | 2 088 |
| Grok 4.5 | grok-4.5 | 33 | 1474 ±12 | 2 590 |
| Claude Sonnet 5 | claude-sonnet-5-high | 36 | 1470 ±11 | 3 001 |
| GPT-5.6 Terra | gpt-5.6-terra-xhigh | 38 | 1469 ±13 | 2 285 |
Расстояние от первой строки этого списка до последней — 50 очков. Первые пять строк лежат в пределах 32 очков друг от друга при интервалах от ±11 до ±15, то есть по этому зачёту они стоят одной группой.
Все эти модели открываются одним ключом и одним рублёвым счётом, а в чате выбираются в списке над полем ввода. Это и есть самый прямой способ проверить порядок из таблицы на своём задании: одинаковый русский текст уходит в две-три модели, и ответы сравниваются рядом.
Русский срез против общего зачёта: где порядок расходится
Общий зачёт Arena снят в тот же день, 27 августа 2026 года, и собран из 7 922 078 голосов по 395 моделям. Сравнение двух таблиц показывает, что именно даёт фильтр по языку.
| Модель | Место в общем зачёте | Оценка в общем зачёте | Место в русском срезе | Оценка в русском срезе |
|---|---|---|---|---|
| claude-fable-5 | 1 | 1507 ±5, 25 824 голоса | 1 | 1519 ±12, 2 547 голосов |
| claude-opus-4-6-high | 2 | 1505 ±4, 72 104 голоса | 6 | 1506 ±8, 7 792 голоса |
| claude-opus-4-7-high | 3 | 1502 ±4, 60 136 голосов | 4 | 1507 ±9, 6 055 голосов |
| muse-spark-1.2 (xHigh) | 4 | 1498 ±10, 3 247 голосов | 3 | 1512 ±32, 329 голосов |
| claude-opus-5-high | 7 | 1492 ±5, 31 570 голосов | 8 | 1500 ±11, 3 392 голоса |
| gemini-3.7-flash-high | 9 | 1490 ±8, 5 720 голосов | 2 | 1517 ±24, 616 голосов |
| claude-opus-5-max | 12 | 1488 ±6, 15 398 голосов | 12 | 1493 ±15, 1 604 голоса |
| gpt-5.6-sol-xhigh | 17 | 1482 ±5, 21 537 голосов | 13 | 1492 ±13, 2 233 голоса |
| gemini-3.6-flash-high | 19 | 1481 ±5, 20 190 голосов | 19 | 1487 ±13, 2 088 голосов |
Первое место совпадает: Claude Fable 5 стоит первым и там, и там. Дальше порядок расходится, и заметнее всего у Gemini 3.7 Flash в режиме high — девятая строка общего зачёта и вторая строка русского. Правда, в русской категории у неё 616 голосов против 5 720 в общем, а интервал ±24 против ±8, и источник помечает обе строки как предварительные.
Оценки в двух таблицах различаются: у Claude Fable 5 — 1519 в русском срезе против 1507 в общем, у Gemini 3.7 Flash в режиме high — 1517 против 1490, у Claude Opus 4.6 в режиме high — 1506 против 1505. Разница чисел между таблицами ничего не говорит о качестве: рейтинг Bradley–Terry — так называется способ пересчёта парных голосов в одно число — считается внутри своего набора голосов, и абсолютные значения двух наборов между собой не сравниваются. Сравнивать имеет смысл порядок строк, а не сами числа.
MERA: экзамен на русском из 23 заданий
MERA ведёт Альянс в сфере ИИ, и в описании проекта перечислены его участники: SberDevices, Sber AI, Yandex, Skoltech AI, MTS AI, НИУ ВШЭ и РАН. Это не голосование, а закрытый набор заданий: 23 задачи, из которых 15 основных с закрытыми ответами и 8 диагностических. Закрытым он назван потому, что правильные ответы нигде не опубликованы: подготовиться к ним заранее нельзя. Прогон идёт через переработанную версию открытого набора Language Model Evaluation Harness 0.4.8, а общий балл в таблице зачёта — это средний балл основных задач, без учёта диагностических; там, где у задачи несколько метрик, то есть несколько способов подсчёта, они сначала усредняются между собой.
Каждое имя в списке ниже — отдельный набор вопросов внутри MERA. Состав основных задач такой: MathLogicQA, MultiQ, PARus, RCB, ruModAr, ruMultiAr, ruOpenBookQA, ruTiE, ruWorldTree, RWSD, SimpleAr, BPS, CheGeKa, LCS, ruHumanEval, ruCodeEval, ruMMLU на 14 012 вопросов с выбором ответа, MaMuRAMu, USE с заданиями ЕГЭ, ruDetox, ruEthics, ruHateSpeech и ruHHH. То есть в один балл сведены школьный экзамен, логика, арифметика, код, работа с этикой и распознавание оскорблений — всё на русском.
Одну особенность методики надо назвать прямо: прогоны присылают сами команды в виде архива с логами, MERA их проверяет и публикует. Поэтому в таблице есть колонка с тем, кто прислал замер, и часть строк прислана самими разработчиками моделей. В таблице ниже эта колонка сохранена.
Числа сняты из копии страницы в веб-архиве от 11 апреля 2026 года. Сам сайт mera.a-ai.ru на момент подготовки этой страницы целиком отдаёт сообщение о технических работах, так что живых чисел с него снять нельзя. Архивная копия разобрана на 595 записей, верх таблицы полный. Шкала — от нуля до единицы.
| Место | Модель | Кто прислал замер | Общий балл | ruMMLU |
|---|---|---|---|---|
| 1 | Claude-Opus-4.6 | MERA | 0,862 | 0,925 |
| 2 | Human Benchmark, живой человек | MERA | 0,852 | 0,844 |
| 3 | GPT-5.4 | MERA | 0,821 | 0,918 |
| 4 | BerryLM-v2-reasoning-budget-low | Wildberries и Russ | 0,81 | 0,873 |
| 5 | Qwen3-235B-A22B-Thinking-2507 | MERA | 0,795 | 0,861 |
| 6 | Cotype Light 3 | MWS AI | 0,792 | 0,732 |
| 7 | BerryLM-L | Wildberries и Russ | 0,775 | 0,825 |
| 8 | Claude Opus 4.5 | сам разработчик | 0,763 | 0,901 |
| 9 | Qwen3-30B-A3B-Thinking-2507 | MERA | 0,747 | 0,804 |
| 10 | BerryLM-MT | Wildberries и Russ | 0,745 | 0,777 |
| 11 | BerryLM | Wildberries и Russ | 0,739 | 0,754 |
| 12 | Qwen3-32B | MERA | 0,731 | 0,821 |
| 13 | GigaChat-3.1-Ultra | GigaChat | 0,712 | 0,814 |
| 16 | GPT-5.2 | сам разработчик | 0,707 | 0,882 |
| 18 | Claude 3.7 Sonnet | llmarena.ru | 0,682 | 0,845 |
| 19 | Gemini 2.0 Flash | llmarena.ru | 0,678 | 0,82 |
| 20 | DeepSeek-V3 | llmarena.ru | 0,677 | 0,8 |
| 24 | Cotype Pro 2.5 | MWS AI | 0,671 | 0,905 |
| 25 | GigaChat 2 Max | GIGACHAT | 0,67 | 0,795 |
| 27 | T-pro-it-2.0 | T-Tech | 0,66 | 0,79 |
Вторая строка таблицы — точка отсчёта. «Human Benchmark» — это результат живого человека на тех же заданиях, который MERA публикует как точку отсчёта, и он равен 0,852. Выше него в апрельском снимке стоит одна строка: Claude-Opus-4.6 с 0,862. Всё остальное, включая GPT-5.4 с 0,821, идёт ниже человеческого результата.
Разбор одного балла на составляющие показывает, из чего он складывается. У первой строки, Claude-Opus-4.6, задания расходятся широко: SimpleAr — 1,0, MathLogicQA и ruMultiAr — по 0,998, BPS — 0,996, ruWorldTree — 0,996, ruTiE — 0,981, ruOpenBookQA — 0,98, LCS — 0,964, PARus — 0,934, RWSD — 0,931, MaMuRAMu — 0,926, ruMMLU — 0,925, ruHHH — 0,916, ruHateSpeech — 0,913, USE с заданиями ЕГЭ — 0,89, CheGeKa — 0,742 и 0,63, RCB — 0,632 и 0,623, MultiQ — 0,597 и 0,398, ruCodeEval — 0,471, 0,553 и 0,579, ruDetox — 0,393, ruEthics — 0,362, ruHumanEval — 0,23, 0,295 и 0,317.
Отсюда видно, что общий балл собран из очень разных по трудности задач: арифметика и подстановка берутся почти полностью, школьный экзамен даёт 0,89, а задания на код и на этику остаются в пределах от 0,23 до 0,579. Модель, у которой общий балл выше на сотую, может отличаться от соседней по строке совсем в другом месте набора.
Колонка ruMMLU полезна отдельно: это 14 012 вопросов с выбором ответа на русском, тот самый разрез, который в подборках называют «MMLU по-русски». По ней порядок местами другой, чем по общему баллу: у Cotype Pro 2.5 ruMMLU 0,905 — третий результат этой колонки в таблице выше, — а по общему баллу она занимает двадцать четвёртую строку с 0,671.
MERA Reason: рассуждение и олимпиадная математика по-русски
MERA Reason ведёт та же команда, но таблица зачёта лежит на Hugging Face Spaces и работает: снимок сделан на обновлении от 30 июля 2026 года, сам Space создан 17 июня 2026 года. Ссылка на источник — таблица зачёта MERA Reason.
Общий балл складывается из четырёх наборов заданий. Что меряет каждый, описано в коде таблицы:
- ruAIME — 724 задачи американской математической олимпиады AIME за 1983–2025 годы, переведённые на русский. Ответ даётся числом, и засчитывается только точное совпадение с эталоном.
- T-math — 310 задач Всероссийской олимпиады школьников и Московской олимпиады за 2005–2025 годы. Ответ засчитывается, если он математически равен эталонному, даже когда записан иначе.
- Luzitania — 251 задание на русском, где к ответу надо прийти в несколько шагов рассуждения; засчитывается точное совпадение ответа.
- MMReD — вопросы по длинному тексту, ответ на которые приходится собирать из разных его мест: 5 типов вопросов на 3 длины текста — 32, 64 и 128 тысяч токенов, — всего 750 вопросов. Пять взвешенных долей точных ответов сводятся в одно число гармоническим средним: провал в любом из пяти типов вопросов тянет итог вниз сильнее, чем высокий результат тянет его вверх.
Примеров решения модели в запросе не получают, а результат выражен долей выполненных заданий в процентах. В таблице 24 модели, состав участников — Anthropic, Google, Alibaba, Z.ai и DeepSeek.
| Место | Модель | Общий балл | ruAIME | T-math | Luzitania | MMReD |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.8 | 80,82 | 98,48 | 78,18 | 58,96 | 93,97 |
| 2 | gemma-4-31B-it | 73,94 | 95,03 | 78,83 | 43,43 | 91,86 |
| 3 | Qwen3.5-122B-A10B | 67,36 | 86,88 | 72,64 | 35,06 | 93,07 |
| 4 | Qwen3.5-27B | 65,54 | 87,71 | 69,38 | 31,47 | 96,36 |
| 5 | GLM-5 | 63,8 | 90,06 | 67,1 | 29,48 | 93,01 |
| 6 | Qwen3.5-35B-A3B | 61,82 | 88,81 | 66,45 | 27,89 | 88,75 |
| 7 | Qwen3.6-27B | 61,02 | 91,71 | 65,47 | 25,1 | 91,96 |
| 8 | DeepSeek-v4-Pro | 60,18 | 88,67 | 67,43 | 23,11 | 94,94 |
| 9 | DeepSeek-v4-Flash | 56,03 | 86,88 | 61,89 | 22,71 | 80,69 |
| 10 | Qwen3.6-35B-A3B | 55,43 | 88,54 | 65,15 | 18,73 | 87,41 |
| 11 | Qwen3-30B-A3B-Thinking-2507 | 51,78 | 87,85 | 63,84 | 18,33 | 69,95 |
| 12 | Qwen3-Next-80B-A3B-Thinking | 50,75 | 84,53 | 57,98 | 18,33 | 73,85 |
| 13 | Qwen3-4B-Thinking-2507 | 46,65 | 77,76 | 50,49 | 16,73 | 72,07 |
| 14 | Qwen3.5-9B | 45,87 | 78,73 | 51,79 | 13,94 | 77,87 |
| 15 | gemma-4-26B-A4B-it | 38,44 | 77,62 | 61,24 | 28,29 | 16,24 |
| 16 | gemma-4-E4B-it | 35,74 | 55,52 | 31,92 | 10,76 | 85,61 |
| 17 | Qwen3.5-4B | 34,12 | 69,61 | 41,04 | 8,76 | 54,09 |
| 18 | gemma-4-E2B-it | 24,6 | 44,06 | 18,89 | 9,56 | 46,02 |
Строки этой таблицы читаются по столбцам не хуже, чем по общему баллу. Первая строка берёт 98,48 на олимпиадных задачах AIME и 58,96 на Luzitania — почти сорок пунктов разницы внутри одной модели. У gemma-4-26B-A4B-it картина обратная: 77,62 на ruAIME и 16,24 на MMReD, то есть задачи на длинном тексте она проходит совсем иначе, чем короткие математические.
Колонка Luzitania держится ниже остальных по всей таблице: 58,96 у первой строки, 43,43 у второй, 35,06 у третьей и 8,76 у семнадцатой. Многошаговое рассуждение на русском — то место, где верх таблицы отрывается от середины сильнее всего. Колонка MMReD, наоборот, у большинства верхних строк стоит в районе девяноста: работа с длинным русским текстом даётся ровнее.
Пометка в имени модели говорит о режиме работы: Thinking — вариант, который перед ответом рассуждает про себя, Instruct — вариант, который отвечает сразу. Конец таблицы занимают строки с пометкой Instruct: Qwen3-235B-A22B-Instruct-2507 — 6,61, Qwen3-30B-A3B-Instruct-2507 — 3,69, Qwen3-Next-80B-A3B-Instruct — 0,5, Qwen3-4B-Instruct-2507 — 0,34. Варианты тех же семейств с пометкой Thinking стоят выше: Qwen3-30B-A3B-Thinking-2507 — 51,78, Qwen3-Next-80B-A3B-Thinking — 50,75, Qwen3-4B-Thinking-2507 — 46,65. Две пометки внутри одного семейства разводят модель по разным концам таблицы.
Топ русских нейросетей: llmarena.ru, где мерка одна на всех
LLM Arena на llmarena.ru — единственный найденный зачёт, где российские и зарубежные модели стоят в одной таблице и померены одинаково. Устроен он так же, как Arena: люди сравнивают ответы двух моделей на русском и голосуют, рейтинг считается по модели Bradley–Terry в шкале Elo. Колонка «Ранг (UB)» — верхняя граница ранга, то есть лучшее место, на которое модель может претендовать: единица плюс число моделей, превосходящих её наверняка с учётом 95-процентного доверительного интервала. Поэтому у нескольких строк подряд стоит один и тот же ранг: между этими моделями зачёт разницы не проводит.
Числа сняты с открытых данных llmarena.ru, и сам источник печатает рядом сводку: 104 модели, 132 622 голоса, пересчёт 18 апреля 2026 года. Голосов здесь на порядок меньше, чем в русской категории Arena, поэтому интервалы широкие: у верхних строк от ±20 до ±39 при разнице между соседями в единицы пунктов. Верхние места источник сам показывает как неразличимые, ставя нескольким моделям подряд ранг «1».
Колонка лицензии делит модели надвое. Закрытая — модель работает только на серверах своего разработчика. Открытая — веса модели, то есть файлы обученной сети, выложены, и её разрешено скачать и запустить у себя.
Верх общего зачёта, снимок 18 апреля 2026 года:
| Ранг (UB) | Модель | Организация | Elo | 95 % ДИ | Голосов | Лицензия |
|---|---|---|---|---|---|---|
| 1 | Gemini 3 Pro Preview | 1210 | +26 / −23 | 537 | закрытая | |
| 1 | Gemini Pro 2.5 Preview 03-25 | 1196 | +25 / −23 | 710 | закрытая | |
| 1 | GPT-5.4 | OpenAI | 1187 | +39 / −34 | 292 | закрытая |
| 1 | Gemini 3.1 Pro Preview | 1181 | +26 / −25 | 516 | закрытая | |
| 1 | Gemini Flash 2.5 Preview 04-17, thinking | 1159 | +28 / −30 | 422 | закрытая | |
| 3 | GPT-5.1 | OpenAI | 1148 | +20 / −21 | 803 | закрытая |
| 4 | DeepSeek V3.2 | DeepSeek | 1133 | +21 / −20 | 797 | открытая |
| 5 | GPT-5 Chat | OpenAI | 1129 | +14 / −13 | 1 665 | закрытая |
| 5 | DeepSeek V3.1 | DeepSeek | 1123 | +17 / −18 | 1 044 | закрытая |
| 5 | GPT-5.2 | OpenAI | 1114 | +19 / −19 | 822 | закрытая |
| 7 | Qwen3 Max | Qwen | 1113 | +14 / −14 | 1 487 | закрытая |
| 7 | Claude Sonnet 4.5 | Anthropic | 1108 | +19 / −19 | 949 | закрытая |
| 7 | Claude Opus 4.1 | Anthropic | 1108 | +18 / −19 | 825 | закрытая |
| 9 | Grok 4 | xAI | 1094 | +14 / −15 | 1 435 | закрытая |
Российские модели в той же таблице, тот же снимок и та же методика:
| Ранг (UB) | Модель | Организация | Elo | 95 % ДИ | Голосов | Лицензия |
|---|---|---|---|---|---|---|
| 11 | Alice AI LLM | Яндекс | 1083 | +13 / −16 | 1 468 | закрытая |
| 27 | t-tech/T-pro-it-2.0 | Т-Банк | 1036 | +19 / −19 | 981 | открытая |
| 41 | GigaChat 2 Max | Сбер | 999 | +17 / −17 | 904 | закрытая |
| 42 | YandexGPT 5.1 Pro | Яндекс | 997 | +17 / −17 | 976 | закрытая |
| 46 | GigaChat 2 Pro | Сбер | 989 | +17 / −18 | 876 | закрытая |
| 47 | RuadaptQwen2.5-32B-Pro-Beta | RefalMachine | 986 | +20 / −20 | 749 | открытая |
| 51 | GigaChat-Max-preview 4.0.26.20 | Сбер | 978 | +15 / −15 | 1 381 | закрытая |
| 50 | t-tech/T-pro-it-1.0 | Т-Банк | 973 | +22 / −21 | 547 | открытая |
| 51 | Vikhr-Nemo-12B-Instruct-R-21-09-24 | Vikhrmodels | 970 | +20 / −18 | 859 | открытая |
| 66 | YandexGPT Experimental | Яндекс | 945 | +15 / −16 | 1 185 | закрытая |
| 63 | t-tech/T-lite-it-1.0 | Т-Банк | 942 | +22 / −21 | 595 | открытая |
| 66 | GigaChat 2 Lite | Сбер | 938 | +17 / −20 | 904 | закрытая |
| 66 | YandexGPT 5 Pro | Яндекс | 936 | +20 / −19 | 921 | закрытая |
| 76 | YandexGPT 4 Pro | Яндекс | 912 | +12 / −12 | 2 009 | закрытая |
| 83 | YandexGPT 3 Pro | Яндекс | 888 | +14 / −13 | 1 767 | закрытая |
| 91 | MTSAIR/Cotype-Nano | МТС | 854 | +18 / −17 | 1 009 | открытая |
Верхняя российская строка — Alice AI LLM с 1083 очками и рангом 11. От первой строки таблицы её отделяет 127 очков, от Claude Opus 4.1 и Claude Sonnet 4.5 — 25 очков при интервале +13 / −16 у самой Alice AI LLM и +19 / −19 у Claude Sonnet 4.5. Следом идут T-pro-it-2.0 от Т-Банка с 1036 и группа моделей Сбера и Яндекса в диапазоне от 999 до 936.
Эта же таблица разложена по видам работы, и разрезы полезны отдельно:
| Разрез | Голосов | Первые строки |
|---|---|---|
| Код | 31 822 | Gemini 3 Pro Preview — 1240; GPT-5.4 — 1222; Gemini Pro 2.5 Preview 03-25 — 1188 |
| Математика | 13 772 | Gemini Pro 2.5 Preview 03-25 — 1216; GPT-5.1 — 1157; DeepSeek R1 0528 — 1154; Claude Sonnet 4.5 — 1146; Alice AI LLM — 1135 |
| Творческие задачи | 26 132 | GPT-5.4 — 1219; Gemini 3 Pro Preview — 1181; Gemini 3.1 Pro Preview — 1164 |
| Наука | 107 302 | Gemini 3 Pro Preview — 1219; Gemini Pro 2.5 Preview 03-25 — 1215; Gemini 3.1 Pro Preview — 1183 |
В разрезе по математике Alice AI LLM стоит пятой строкой с 1135 очками, тогда как в общем зачёте той же таблицы у неё ранг 11 и 1083 очка. Разрез по науке — самый крупный по числу голосов, 107 302; разрез по математике — самый мелкий, 13 772.
Дату этого зачёта надо держать в голове при каждом его числе: таблица пересчитана 18 апреля 2026 года. Она отвечает на вопрос, как выглядели модели весной, а не что происходит сейчас.
ГигаЧат: что о нём говорят зачёты
ГигаЧат — русскоязычная нейросеть Сбера, и её строки есть в двух зачётах из четырёх.
В апрельском снимке MERA выше всех моделей Сбера стоит GigaChat-3.1-Ultra: общий балл 0,712 при ruMMLU 0,814, тринадцатая строка таблицы. Замер прислан командой GigaChat — это записано в самой таблице MERA в колонке о том, кто присылал прогон. Дальше в том же снимке идут GigaChat 2 Max с общим баллом 0,67 и ruMMLU 0,795 на двадцать пятой строке, GigaChat 2 Pro с 0,649 на двадцать восьмой, GigaChat Max с 0,588 на пятьдесят восьмой, GigaChat 2 с 0,541 на девяносто шестой, GigaChat-20B-A3B с 0,513, GigaChat Pro с 0,512, GigaChat-3.1-Lightning с 0,501 и GigaChat с 0,5 на сто тридцать шестой.
В llmarena.ru у Сбера самая высокая строка — GigaChat 2 Max с 999 очками и рангом 41, за ней GigaChat 2 Pro с 989 и GigaChat-Max-preview 4.0.26.20 с 978. Снимок от 18 апреля 2026 года.
Чего в этих числах не видно, показывают живые пробы. Автор канала «ХАБ. AI» в разборе российских сервисов отдельно останавливается на входе: чтобы открыть ГигаЧат, нужна учётная запись Сбербанка, и такой порядок входа он называет необычным для нейросетей. Автор канала Tema Romanov, давая ГигаЧату и Алисе одинаковые деловые задания — коммерческое предложение, резюме встречи, разбор документа, генерация картинок, — отметил простой интерфейс с кнопкой доработки полученного текста прямо в окне и превращение готового текста в подкаст с выбором дикторов и длительности. По его же наблюдению, надписи внутри сгенерированных ГигаЧатом картинок выходят разборчивыми: буквы на кадре он прочитал полностью.
Слепое голосование сравнивает текст ответа. Порядок входа, кнопки в окне переписки и подкасты показывает живая проба — эта часть работы сервиса видна в разборах, а не в таблицах.
Алиса и YandexGPT в зачётах
Алиса AI — чат Яндекса, и в llmarena.ru её строка называется Alice AI LLM. В снимке от 18 апреля 2026 года у неё 1083 очка, ранг 11 и 1 468 голосов — выше всех прочих российских моделей в этой таблице. В разрезе по математике той же таблицы она стоит пятой с 1135 очками.
Модели YandexGPT померены там же: YandexGPT 5.1 Pro — 997 очков и ранг 42, YandexGPT Experimental — 945, YandexGPT 5 Pro — 936, YandexGPT 4 Pro — 912 при 2 009 голосах, YandexGPT 3 Pro — 888, YandexGPT 3 Lite — 868.
Живая проба показывает, что стоит за числами. Автор канала Tema Romanov, задавая Алисе вопрос без отдельной команды на размышление, увидел, что она сама пошла в интернет, нашла подтверждения и привела их в ответе. Он же в другой задаче дал сервисам заведомо выдуманную новость и смотрел, что они с ней сделают: Алиса, по его описанию, приняла событие как случившееся и стала рассуждать дальше, а ГигаЧат подтянул к нему события примерно десятилетней давности. Автор «ХАБ. AI» на разборе скриншота получил от Алисы верный подсчёт времени сразу, а от ГигаЧата — после уточнения.
Отдельное сравнение Алисы с зарубежной моделью на живых заданиях собрано на странице Алиса или DeepSeek.
T-Pro, Cotype, BerryLM и другие российские модели
Российских моделей в замерах больше, чем два известных чата: в апрельском снимке MERA их строки начинаются с четвёртого места и дальше идут через всю таблицу.
| Место в снимке | Модель | Кто прислал замер | Общий балл | ruMMLU |
|---|---|---|---|---|
| 4 | BerryLM-v2-reasoning-budget-low | Wildberries и Russ | 0,81 | 0,873 |
| 6 | Cotype Light 3 | MWS AI | 0,792 | 0,732 |
| 7 | BerryLM-L | Wildberries и Russ | 0,775 | 0,825 |
| 10 | BerryLM-MT | Wildberries и Russ | 0,745 | 0,777 |
| 11 | BerryLM | Wildberries и Russ | 0,739 | 0,754 |
| 13 | GigaChat-3.1-Ultra | GigaChat | 0,712 | 0,814 |
| 24 | Cotype Pro 2.5 | MWS AI | 0,671 | 0,905 |
| 25 | GigaChat 2 Max | GIGACHAT | 0,67 | 0,795 |
| 27 | T-pro-it-2.0 | T-Tech | 0,66 | 0,79 |
| 28 | GigaChat 2 Pro | GIGACHAT | 0,649 | 0,745 |
| 33 | Cotype, предварительная версия | MTS AI | 0,633 | 0,903 |
| 35 | T-pro-it-1.0 | T-Tech | 0,629 | 0,768 |
| 37 | Zero-Mistral-24B | ZeroAgency | 0,623 | 0,778 |
| 39 | A-vibe | Avito | 0,618 | 0,686 |
| 43 | RuadaptQwen-32B-instruct | RCC MSU | 0,615 | 0,737 |
| 89 | T-lite-it-1.0 | T-Tech | 0,552 | 0,664 |
| 100 | RuadaptQwen2.5-7B-Lite-v1 | RCC MSU | 0,536 | 0,64 |
| 120 | T-lite-0.1 | Т-Банк | 0,51 | 0,549 |
Четвёртая строка всего снимка — BerryLM-v2-reasoning-budget-low от Wildberries и Russ с общим баллом 0,81. Выше неё стоят только Claude-Opus-4.6, замер живого человека и GPT-5.4. Шестая строка — Cotype Light 3 от MWS AI с 0,792. Замеры этих строк прислали сами разработчики, и в таблице MERA это указано колонкой.
У части российских строк колонка ruMMLU стоит заметно выше общего балла. У Cotype Pro 2.5 общий балл 0,671 при ruMMLU 0,905, у предварительной версии Cotype — 0,633 при ruMMLU 0,903. Вопросы с выбором ответа на русском эти модели берут на уровне верха таблицы, а сводный балл у них ниже за счёт остальных четырнадцати задач набора.
Шедеврум и Kandinsky: работа с картинками по русскому описанию
Шедеврум у Яндекса и Kandinsky у Сбера делают картинки и короткие ролики. Зачёты, разобранные выше, меряют текст; работу с картинками меряют собственные зачёты, и они устроены так же — слепое сравнение двух результатов по одному запросу.
Свежий зачёт по генерации изображений — Text to Image Arena у Artificial Analysis, где оценивающему показывают два изображения по одному запросу без названий, а рейтинг считается тем же методом Bradley–Terry и переводится в шкалу Elo. В снимке от 30 августа 2026 года первая строка — GPT Image 2 в режиме high с 1369,8 очка при 14 868 голосах, вторая — MAI-Image-2.6-Preview с 1350,6, третья — Reve 2.1 с 1322,4, четвёртая — Nano Banana 2 с 1320,6 при 16 027 голосах. Всего в зачёте 158 моделей.
Полный разбор картиночных зачётов с таблицами и ценами — на странице лучшая нейросеть для картинок. Видео разобрано отдельно: лучшие нейросети для видео. Работа с изображениями прямо на сайте — нейросеть для картинок.
История вопроса: семь замеров русского языка 2024 и 2025 годов
Семь остальных найденных зачётов по русскому собраны раньше 2026 года. Их числа полезны как история: они описывают прошлое поколение моделей.
PingPong ведёт Илья Гусев. Модель-«интервьюер» изображает пользователя в ролевых диалогах с набором персонажей, проверяемая модель отвечает, а модель-судья оценивает по трём признакам: остаётся ли ответ в образе, беглость языка и развлекательность. Отдельная колонка беглости языка прямо относится к качеству русского. Данные на 25 мая 2025 года, 82 модели, шкала от 1 до 5. Верх: deepseek_v3_0324 — 4,79 ±0,04 при беглости 4,96; claude_3_5_sonnet_20241022 — 4,78 при беглости 4,94; gpt_45_preview — 4,75 при беглости 4,99. Российские строки того же снимка: saiga_yandexgpt_8b — 4,59 при беглости 4,98, t_pro_it_1_0 — 4,46 при беглости 4,94, gigachat_max_preview — 4,23 при беглости 4,90, yandexgpt_4_pro — 4,11 при беглости 4,92.
Колонка беглости в этом зачёте отдельно показательна: у российских строк она держится на уровне 4,90–4,98, то есть совпадает с верхом таблицы, а расходятся строки в основном по двум другим признакам.
ru_llm_arena от VikhrModels — переработка набора Arena-Hard-Auto под русский язык: 500 запросов по 50 темам, модель-судья GPT-4-1106-preview сравнивает ответы с базовой моделью gpt-3.5-turbo-0125, каждое сравнение делается дважды с перестановкой ответов. Состояние арены — на 27 октября 2024 года. Верх: gpt-4-1106-preview — 90,9, gpt-4o-mini — 83,9, T-Tech-T-pro-it-1.0 — 83,8, gigachat_max_26.20_uncen — 82,7, vikhr-nemo-12b-instruct-r-21-09-24 — 79,8, T-Tech-T-lite-it-1.0 — 71,0, yandex_gpt_pro_v4_26102024 — 50,5. Авторы прямо приводят в описании оговорку: по сообщениям Ильи Гусева, одна из моделей при дообучении содержала часть ответов из набора, что могло завысить её результат.
MMLU-ProX, срез по русскому — 11 829 одинаковых вопросов на 29 языках по 10 вариантов ответа. На сайте проекта стоит пометка «Leaderboard (Coming Soon)», а числа опубликованы в статье EMNLP ноября 2025 года, откуда они и взяты. Русская колонка: Qwen3-235B-Think — 77,0, DeepSeek-R1 — 76,4, DeepSeek-V3 — 74,9, Qwen3-235B — 72,9, GPT-4.1 — 71,2, Qwen3-32B-Think — 69,1, Qwen3-32B — 68,0, Phi4-14B — 65,2, Gemma3-27B — 62,5. Английская колонка тех же моделей: 80,7, 79,5, 79,6, 73,5, 79,8, 74,9, 71,8, 71,5, 66,5. У Qwen3-235B-Think разница между русской и английской колонкой — 3,7 пункта, у DeepSeek-R1 — 3,1; у GPT-4o она обратная: 62,0 по-русски против 59,9 по-английски.
Small Shlepa от VikhrModels — русские вопросы с выбором ответа по праву, кино, книгам и музыке. Последний коммит в репозиторий — 8 августа 2024 года, состав таблицы — открытые модели того времени.
RussianSuperGLUE — 9 задач на понимание русского языка, тот проект, продолжением которого MERA называет себя на своём сайте. В таблице 44 строки, первая — HUMAN BENCHMARK с 0,811, вторая — ruadapt Solar 10.7 twostage от RCC MSU с 0,805, третья — Mistral 7B LoRA от Saiga team с 0,763. Состав участников — дообученные модели-энкодеры прошлого поколения: не чат-модели, а сети, которые настраивали под каждую задачу отдельно.
INCLUDE — 197 243 пары «вопрос — ответ» из локальных экзаменационных источников на 44 языках, статья ноября 2024 года. Русский представлен 10 169 вопросами. По языкам опубликован один замер, GPT-4o: русский — 75,00 %, гуманитарные дисциплины — 77,5, STEM — 83,4, прикладные — 70,8, лицензии — 63,9.
Global-MMLU — MMLU с переводом, выверенным носителями, 42 языка, русский входит в число одиннадцати языков с проверенным человеком переводом. Статья декабря 2024 года; результаты в ней опубликованы по группам языков, а не таблицей «модель на язык».
Общее правило по всем семи: числа из них отвечают на вопрос о моделях своего времени. Свежую картину дают Arena с фильтром Russian и MERA Reason, а таблицы MERA и llmarena.ru стоят на апрельских датах — 11 и 18 апреля 2026 года соответственно.
Что стоит за местом в зачёте: чем модель берёт на русском
Место в таблице складывается из разных вещей у разных зачётов, и на этом строится выбор под работу.
Слепое голосование сравнивает то, что человек получил в ответ на свой живой запрос. Оно чувствительно к оформлению, длине и тону ответа, поэтому у Arena по умолчанию включена поправка на оформление — источник вычитает из рейтинга то, что ответ просто аккуратнее разложен по пунктам, — а у llmarena.ru она стоит переключателем. Это зачёт про повседневную переписку: как модель отвечает на то, с чем к ней приходят.
Закрытый набор заданий сравнивает долю правильных ответов. У MERA это 15 основных задач: школьный экзамен, вопросы с выбором ответа, логика, арифметика, код, работа с этикой. Счёт ведётся по совпадению с эталоном: ответ либо совпал, либо нет. Это зачёт про знания и точность.
Набор на рассуждение сравнивает способность довести вывод до конца. У MERA Reason это олимпиадные задачи, где ответ проверяется на математическую равнозначность эталону, и длинный текст, где надо собрать ответ из разбросанных по нему кусков. Разница между двумя вариантами одной модели видна там прямо в таблице: строки с пометкой Thinking стоят выше строк с пометкой Instruct того же семейства.
Разрезы по видам работы есть у llmarena.ru: код, математика, творческие задачи и наука, и у каждого разреза своё число голосов и своя верхняя строка.
Отсюда практическое правило чтения. Модель, стоящая высоко в слепом голосовании, отвечает так, как людям нравится читать по-русски. Модель, стоящая высоко в MERA, точнее отвечает на вопросы с проверяемым ответом. Это не одно и то же свойство, и верх у двух таблиц разный.
Разбор по работам: под какую задачу какая модель
Повседневная переписка и рабочие письма на русском. Смотреть надо на русский срез Arena: там голосуют люди, писавшие свои запросы по-русски. Верх — Claude Fable 5 с 1519, Gemini 3.7 Flash в режиме high с 1517, Muse Spark 1.2 с 1512 (снимок 27 августа 2026 года). Из моделей каталога GEN202 в первой двадцатке этого среза стоят Claude Fable 5, Claude Opus 5, GPT-5.6 Sol и Gemini 3.6 Flash.
Задачи с проверяемым ответом: расчёты, экзаменационные вопросы, разбор условий. Здесь работает MERA: Claude-Opus-4.6 с 0,862, живой человек с 0,852, GPT-5.4 с 0,821 (снимок из веб-архива 11 апреля 2026 года). Колонка ruMMLU внутри того же снимка показывает отдельно вопросы с выбором ответа: 0,925 у первой строки, 0,918 у GPT-5.4, 0,905 у Cotype Pro 2.5.
Многошаговое рассуждение и олимпиадная математика по-русски. MERA Reason: Claude Opus 4.8 с 80,82, gemma-4-31B-it с 73,94, Qwen3.5-122B-A10B с 67,36 (обновление 30 июля 2026 года). Внутри набора самый разделяющий столбец — Luzitania: 58,96 у первой строки против 43,43 у второй.
Длинный русский текст в одном запросе. Работу с длинным насыщенным текстом меряет столбец MMReD в MERA Reason: 5 типов вопросов на трёх длинах — 32, 64 и 128 тысяч токенов. Верхние строки: Qwen3.5-27B — 96,36, DeepSeek-v4-Pro — 94,94, Claude Opus 4.8 — 93,97, Qwen3.5-122B-A10B — 93,07. По каталогу GEN202 размер окна контекста — сколько текста помещается в один запрос — такой: у трёх уровней GPT-5.6 — 1 050 000 токенов и ответ до 128 000, у трёх моделей Claude — 1 000 000 и ответ до 128 000, у Gemini 3.6 Flash — 1 000 000 и ответ до 64 000, у Grok 4.5 — 500 000 токенов. Как считается счёт за длинный запрос, разобрано отдельно: что такое миллион токенов.
Код с русскими комментариями и постановкой задачи на русском. Разрез «код» у llmarena.ru: Gemini 3 Pro Preview — 1240, GPT-5.4 — 1222, Gemini Pro 2.5 Preview 03-25 — 1188, всего 31 822 голоса (снимок 18 апреля 2026 года). Свежие зачёты по коду собраны на отдельной странице: лучшая нейросеть для написания кода.
Творческий текст на русском: истории, сценарии, посты. Разрез «творческие задачи» у llmarena.ru: GPT-5.4 — 1219, Gemini 3 Pro Preview — 1181, Gemini 3.1 Pro Preview — 1164, 26 132 голоса. Ролевые диалоги и беглость языка мерил PingPong: deepseek_v3_0324 — 4,79 при беглости 4,96, gpt_45_preview — 4,75 при беглости 4,99 (25 мая 2025 года, история вопроса).
Тексты на потоке. Порядок работы, ставки и разбор моделей под письменную работу собраны на странице нейросеть для написания текстов, а рабочий чат для этого — нейросеть для текста.
Лучшая бесплатная нейросеть на русском: модели с открытой лицензией
Лицензию два зачёта печатают прямо рядом с названием модели — llmarena.ru и Arena, — и по этой колонке список собирается из таблиц выше.
Из русской арены llmarena.ru, снимок 18 апреля 2026 года:
| Ранг (UB) | Модель | Организация | Elo | Голосов |
|---|---|---|---|---|
| 4 | DeepSeek V3.2 | DeepSeek | 1133 | 797 |
| 9 | DeepSeek V3 0324 | DeepSeek | 1091 | 1 455 |
| 9 | DeepSeek R1 | DeepSeek | 1086 | 789 |
| 9 | Xiaomi MiMo-V2-Flash | Xiaomi | 1083 | 669 |
| 11 | Qwen3 235B A22B | Qwen | 1076 | 658 |
| 16 | MiniMax M2.1 | MiniMaxAI | 1063 | 909 |
| 27 | t-tech/T-pro-it-2.0 | Т-Банк | 1036 | 981 |
| 47 | RuadaptQwen2.5-32B-Pro-Beta | RefalMachine | 986 | 749 |
| 51 | Vikhr-Nemo-12B-Instruct-R-21-09-24 | Vikhrmodels | 970 | 859 |
| 63 | t-tech/T-lite-it-1.0 | Т-Банк | 942 | 595 |
| 91 | MTSAIR/Cotype-Nano | МТС | 854 | 1 009 |
Верхняя строка списка — DeepSeek V3.2 с 1133 очками и рангом 4. Из российских открытых моделей выше всех T-pro-it-2.0 от Т-Банка с 1036 очками; в апрельском снимке MERA у неё общий балл 0,66 при ruMMLU 0,79.
Из Arena, где лицензия тоже стоит колонкой: kimi-k3-max от Moonshot идёт под собственной лицензией Kimi K3 и занимает восемнадцатое место русского среза — 1488 ±14 при 1 783 голосах (снимок 27 августа 2026 года). GLM-5.3 max от Z.ai стоит под лицензией MIT и занимает в русском срезе тридцать пятое место с 1471 ±23 при 688 голосах, а в общем зачёте того же дня — пятнадцатое с 1484 ±8 при 5 820 голосах.
Открытая лицензия означает, что модель разрешено скачать и запустить на своём оборудовании. Второй путь попробовать модель на своём русском тексте — чат на этой странице: первая работа идёт за счёт сервиса. После входа новому счёту начисляется 50 кредитов (25 ₽), и этого хватает, чтобы прогнать одно и то же задание через несколько моделей и сравнить ответы.
Сколько стоит русский текст
Русский текст пишут те же восемь текстовых моделей каталога, что и любой другой, и счёт у них идёт за токены: отдельно за то, что вы отправили, отдельно за то, что модель написала в ответ. Ставка GEN202 ниже официальной цены разработчика на десять процентов, оплата рублями, ключ один на весь каталог.
| Модель | Официально, $ за млн вход / выход | GEN202, вход | GEN202, выход | Контекст, токенов |
|---|---|---|---|---|
| GPT-5.6 Luna | 0,2 / 1,2 | 18 ₽ | 108 ₽ | 1 050 000 |
| GPT-5.6 Terra | 2 / 12 | 180 ₽ | 1080 ₽ | 1 050 000 |
| GPT-5.6 Sol | 5 / 30 | 450 ₽ | 2700 ₽ | 1 050 000 |
| Gemini 3.6 Flash | 1,5 / 7,5 | 135 ₽ | 675 ₽ | 1 000 000 |
| Grok 4.5 | 2 / 6 | 180 ₽ | 540 ₽ | 500 000 |
| Claude Opus 5 | 5 / 25 | 450 ₽ | 2250 ₽ | 1 000 000 |
| Claude Sonnet 5 | 2 / 10 | 180 ₽ | 900 ₽ | 1 000 000 |
| Claude Fable 5 | 10 / 50 | 900 ₽ | 4500 ₽ | 1 000 000 |
Цены в рублях — за миллион токенов; они подставляются из каталога и меняются вместе с ним. Полный список моделей со ставками — в каталоге, примеры вызова текстовых моделей — на странице API языковых моделей, сравнение с официальными ставками — на странице цен.
Первая строка русского зачёта и самая дешёвая строка каталога — разные модели, и таблицы выше показывают это прямо. Claude Fable 5 стоит первым в русском срезе Arena при официальной цене 10 и 50 долларов за миллион токенов. Gemini 3.6 Flash стоит девятнадцатым в том же срезе при официальной цене 1,5 и 7,5 доллара за миллион токенов. Расстояние между ними в таблице — 32 очка при интервалах ±12 и ±13.
Вторая ступень цены срабатывает на длинном запросе, и по каталогу она устроена так: у трёх уровней GPT-5.6 порог стоит на 272 000 входных токенов и включается строго выше него — официальная цена Luna меняется с 0,2 и 1,2 доллара на 0,4 и 1,8, у Terra с 2 и 12 на 4 и 18, у Sol с 5 и 30 на 10 и 45. Grok 4.5 доходит до второй ступени на 200 000 токенов и считает по ней уже с самого порога: длинный русский текст такого объёма идёт по 4 и 12 долларов вместо 2 и 6. У Gemini 3.6 Flash и у трёх моделей Claude ставка одна на любой длине запроса.
Про рублёвую оплату и способы платежа за зарубежные модели отдельно написано на странице оплата нейросетей, а про доступ к ним из России — на странице нейросети в России.
Что брать под работу: сводная таблица
| Работа | Что показывают зачёты | Источник и дата снимка |
|---|---|---|
| Повседневная переписка и письма по-русски | Claude Fable 5 — 1519, Gemini 3.7 Flash (high) — 1517, Muse Spark 1.2 — 1512 | Arena, срез Russian, 27 августа 2026 |
| Рассуждение и олимпиадная математика на русском | Claude Opus 4.8 — 80,82, gemma-4-31B-it — 73,94, Qwen3.5-122B-A10B — 67,36 | MERA Reason, 30 июля 2026 |
| Экзаменационные задания, знания, точность | Claude-Opus-4.6 — 0,862, живой человек — 0,852, GPT-5.4 — 0,821 | MERA, снимок из веб-архива 11 апреля 2026 |
| Вопросы с выбором ответа на русском | Claude-Opus-4.6 — 0,925, GPT-5.4 — 0,918, Cotype Pro 2.5 — 0,905 | ruMMLU внутри MERA, 11 апреля 2026 |
| Российские и зарубежные модели одной меркой | Gemini 3 Pro Preview — 1210, Alice AI LLM — 1083, T-pro-it-2.0 — 1036, GigaChat 2 Max — 999 | llmarena.ru, 18 апреля 2026 |
| Длинный русский текст в одном запросе | Qwen3.5-27B — 96,36, DeepSeek-v4-Pro — 94,94, Claude Opus 4.8 — 93,97 | MMReD внутри MERA Reason, 30 июля 2026 |
| Постановка задачи по коду на русском | Gemini 3 Pro Preview — 1240, GPT-5.4 — 1222 | разрез «код» llmarena.ru, 18 апреля 2026 |
| Творческий текст на русском | GPT-5.4 — 1219, Gemini 3 Pro Preview — 1181 | разрез «творческие задачи» llmarena.ru, 18 апреля 2026 |
| Беглость русской речи в диалоге | gpt_45_preview — 4,99, gemma3_27b_it — 4,99, deepseek_v3_0324 — 4,96 | PingPong, 25 мая 2025 — история вопроса |
| Дешёвый вход на длинном русском тексте | GPT-5.6 Luna — 18 ₽ за миллион входных токенов | Каталог GEN202 |
Читать таблицу стоит по строкам. У одного человека выходит два-три разных ответа под разные работы, и это нормальный итог: верх у разных зачётов разный, потому что задания в них разные.
Общий разбор всех задач сразу — тексты, картинки, видео, код — собран в статье про лучшую нейросеть под задачу. Сравнение агрегаторов доступа между собой — на странице агрегатор нейросетей.
Доступ к моделям за рубли, одним ключом
Модели из таблиц выше открываются в GEN202 одним ключом и одним рублёвым счётом: семейство Claude, GPT, Gemini, Grok и остальной каталог. Регистрация российская, счёт рублёвый, ставка на десять процентов ниже официальной цены разработчика, и при первом входе на счёт начисляется 50 кредитов (25 ₽).
Русский текст здесь идёт по тем же ставкам, что и любой другой: счёт считается за токены, а не за язык. Самый дешёвый вход в каталоге — 18 ₽ за миллион входных токенов.
Работать с моделями можно двумя способами. Чат открывается в браузере, переписка сохраняется, а имя модели выбирается в списке над строкой ввода — это путь для человека, который пишет и читает сам. Ключ подставляется в приложение, скрипт или сценарий автоматизации — это путь для работы на потоке: бот, обработка заявок, подготовка текстов пачками. Сколько запросов помещается в один разговор и как считаются ограничения, разобрано на странице лимиты нейросетей.
FAQ
Какая самая лучшая русская нейросеть? Среди моделей, сделанных в России, выше всех в единственной таблице, где российские и зарубежные модели померены одинаково, стоит Alice AI LLM от Яндекса — 1083 очка и ранг 11 (llmarena.ru, пересчёт 18 апреля 2026 года). В апрельском снимке MERA верхняя российская строка — BerryLM-v2-reasoning-budget-low от Wildberries и Russ с общим баллом 0,81, следом Cotype Light 3 от MWS AI с 0,792 и GigaChat-3.1-Ultra с 0,712; замеры этих строк присланы самими разработчиками. Среди моделей, отвечающих по-русски вообще, первую строку русского среза Arena занимает Claude Fable 5 с 1519 очками (снимок 27 августа 2026 года).
Лучшая нейросеть онлайн на русском — какая? По слепым голосам живых людей, писавших запросы по-русски, верх таблицы такой: Claude Fable 5 — 1519 ±12, Gemini 3.7 Flash в режиме high — 1517 ±24, Muse Spark 1.2 в режиме xHigh — 1512 ±32 (Arena, срез Russian, 27 августа 2026 года, 804 885 голосов по русскому, 359 моделей). Колонку «Разброс места» источник печатает рядом: у первой строки это 1–10, то есть верхняя десятка здесь читается как группа, а не как порядок.
Какие есть лучшие нейросети на русском онлайн бесплатно? Лицензию печатают колонкой два зачёта. В llmarena.ru открытая лицензия стоит у DeepSeek V3.2 с 1133 очками и рангом 4, у DeepSeek V3 0324 с 1091, у Qwen3 235B A22B с 1076, у t-tech/T-pro-it-2.0 с 1036 и у Vikhr-Nemo-12B с 970 (снимок 18 апреля 2026 года). В Arena под лицензией MIT идёт GLM-5.3 max — тридцать пятое место русского среза с 1471 ±23, а kimi-k3-max под собственной лицензией Kimi K3 занимает там восемнадцатое место с 1488 ±14 (снимок 27 августа 2026 года). Открытую модель можно скачать и запустить на своём оборудовании. Попробовать закрытые модели на своём русском тексте можно в чате на этой странице: первая работа идёт за счёт сервиса.
Лучшая бесплатная нейросеть на русском — с чего начать проверку? Возьмите своё рабочее задание на русском, а не придуманное: короткий общий вопрос модели проходят почти одинаково, а расходятся они на длинном тексте, на нескольких условиях сразу и на задачах, где надо довести вывод до конца. Это видно прямо в таблицах: в MERA Reason столбец Luzitania с многошаговым рассуждением разводит первую и вторую строки больше чем на пятнадцать пунктов, тогда как на задачах AIME разница между ними — три с половиной пункта.
Чем русские нейросети отличаются от зарубежных по замерам? Единственная таблица, где те и другие померены одинаково, — llmarena.ru от 18 апреля 2026 года. В ней верх занимают Gemini 3 Pro Preview с 1210, Gemini Pro 2.5 Preview с 1196 и GPT-5.4 с 1187, а верхняя российская строка — Alice AI LLM с 1083. В разрезе по математике той же таблицы Alice AI LLM стоит пятой с 1135 очками. В апрельском снимке MERA российские модели занимают четвёртую, шестую, седьмую строки и дальше: BerryLM-v2 с 0,81, Cotype Light 3 с 0,792, BerryLM-L с 0,775.
Какая нейросеть лучше всех понимает русский язык на экзаменационных вопросах? По разрезу ruMMLU внутри MERA — 14 012 вопросов с выбором ответа на русском — верх такой: Claude-Opus-4.6 с 0,925, GPT-5.4 с 0,918, Cotype Pro 2.5 с 0,905, предварительная версия Cotype с 0,903, Claude Opus 4.5 с 0,901 (снимок из веб-архива 11 апреля 2026 года). Замер живого человека на всём наборе MERA равен 0,852 при ruMMLU 0,844.
Почему в разных рейтингах русских нейросетей разные победители? Потому что зачёты меряют разную работу и собраны на разных участниках. Arena считает голоса людей на живых русских запросах, MERA — долю правильных ответов на закрытом наборе из 23 заданий, MERA Reason — доведение вывода до конца на олимпиадных задачах, llmarena.ru — снова голоса, но со своим составом моделей. Составы участников у этих таблиц почти не пересекаются, поэтому места из одной в другую не переносятся. Плюс даты: свежие числа — 27 августа и 30 июля 2026 года, а таблицы MERA и llmarena.ru стоят на 11 и 18 апреля 2026 года.
Что у Artificial Analysis есть по русскому языку? Сводный индекс Artificial Analysis собран на англоязычных заданиях — это написано на странице методики источника. Многоязычность там меряется отдельным набором на основе Global-MMLU-Lite, примерно 400 вопросов на язык, и в его список входят английский, китайский, хинди, испанский, французский, арабский, бенгальский, португальский, индонезийский, японский, суахили, немецкий, корейский, итальянский, йоруба и бирманский. Русский меряют Arena с фильтром Russian, MERA, MERA Reason и llmarena.ru — четыре зачёта, разобранные выше.
Можно ли сравнить несколько моделей на одном русском тексте? Да, и это самый прямой способ выбрать. GEN202 даёт один ключ ко всему каталогу и общий счёт в рублях: одно и то же задание уходит в Claude Fable 5, в GPT-5.6 Sol и в Gemini 3.6 Flash, а дальше вы сравниваете, что вернулось. В чате ключ для этого не нужен — модель выбирается в списке над полем ввода.
Чат с нейросетью онлайн
Claude, ChatGPT, Gemini, Grok и другие нейросети открываются в одном окне браузера, отдельная установка для этого не нужна. Выберите нужную в списке над полем ввода и напишите задание по-русски: первый ответ бесплатно и без регистрации. Больше моделей и история разговоров — в чате с нейросетью.