Лучшая нейросеть выбирается под задачу, и на этой странице для каждой задачи названа модель, которая стоит наверху свежего слепого зачёта, — с именем источника, датой снимка и числом голосов, на которых держится оценка. Тексты, код, картинки, видео, обработка готовых фотографий и работа на русском языке разобраны по отдельности: в каждом разделе стоит короткий ответ, таблица зачёта, цена работы у разработчика и у GEN202, а дальше ссылка на подробный разбор этой задачи.
Попробуйте GPT-5.6, Gemini 3.6 Flash, Claude и Grok 4.5 — чат с нейросетью онлайн и без регистрации, ниже на странице.
Какая нейросеть лучше: короткий ответ по каждой задаче
Верх зачёта у каждой задачи свой, и одна модель первое место везде не занимает. Ниже — сводка по шести задачам: кто наверху, в каком зачёте это измерено и когда снят результат.
Числа в таблице разного рода, и читаются они по-разному. Баллы индекса — сводная оценка по наборам заданий с проверяемым ответом. Проценты — доля задач, решение которых подтвердили тесты. Elo — оценка из слепых голосов: человеку показывают два ответа на один и тот же запрос, названия моделей скрыты, он выбирает лучший, и из тысяч таких голосов складывается одно число. Чем Elo выше, тем чаще модель выбирают. Числа из разных зачётов между собой не сравниваются: у каждого своя шкала.
| Задача | Кто наверху | Подробный разбор | Зачёт и дата снимка |
|---|---|---|---|
| Тексты, переписка, разбор документов | Claude Opus 5 — 63,1 балла индекса | нейросеть для написания текстов | Artificial Analysis Intelligence Index v4.1.1, снимок 30.08.2026 |
| Код и программирование | Claude Code с Opus 5 — 51,82 % решённых задач | лучшая нейросеть для кода | Terminal-Bench 4.0, таблица обновлена 29.08.2026 |
| Картинки с нуля по описанию | GPT Image 2 (high) — Elo 1369,8 | лучшая нейросеть для картинок | Artificial Analysis Text to Image Arena, снимок 30.08.2026 |
| Правка готового снимка | gpt-image-2 (medium) — Elo 1462 | нейросети для обработки фото | Arena, Image Edit Arena, отсечка голосов 25.08.2026 |
| Видео по описанию со звуком | Wan 3.0 — Elo 1242 | лучшие нейросети для видео | Artificial Analysis, Text to Video, снимок 30.08.2026 |
| Работа на русском языке | Claude Fable 5 — 1519 очков | лучшие нейросети на русском | Arena, Text Arena с фильтром Russian, снимок 27.08.2026 |
Шесть разных имён в шести строках — это и есть содержательный ответ на вопрос «какая нейросеть лучше». Модель, которая выигрывает слепое голосование на текстах, и модель, которая доводит до конца задачу в терминале, — разные модели, потому что и задания разные, и способ подсчёта разный. Дальше каждая строка разобрана отдельно: что именно меряет зачёт, с каким отрывом идёт первое место, на скольких голосах держится оценка и сколько стоит работа этой модели.
Отдельно стоит вопрос про открытые веса — так называют модели, выложенные для скачивания и запуска на своём оборудовании. В тех же таблицах рядом с каждой моделью напечатана её лицензия, и по этой колонке видно, какие из участников зачёта выложены под MIT или Apache 2.0. Разбор этой колонки — в разделе про бесплатные нейросети.
На чём стоят ответы: слепые зачёты, даты снимков и число голосов
Все числа на странице сняты с четырёх источников, и у каждого источника своя процедура. Понимание процедуры важнее самого числа: она объясняет, почему в двух зачётах по одной теме наверху стоят разные модели.
Artificial Analysis, Intelligence Index v4.1.1. Это коммерческая аналитическая компания: она сама прогоняет модели по открытому доступу, который дают разработчики, и к самим разработчикам отношения не имеет. Сводный индекс собран из девяти прогонов, взвешенных по четырём группам: агентные задачи дают 34 % итога, код — 24 %, научное рассуждение — 24 %, общие знания — 18 %. Состав индекса опубликован построчно — у каждого набора заданий назван его размер, число повторов и доля в итоге: GDPval-AA v2 — 220 задач в один повтор, вес 20 %; Terminal-Bench v2.1 — 89 задач в три повтора, вес 16 %; 𝜏³-Banking — 97 задач в пять повторов, вес 14 %; AA-Omniscience — 6000 вопросов в один повтор, вес 12 %; Humanity’s Last Exam — 2158 вопросов в один повтор, вес 12 %; SciCode — 288 подзадач в три повтора, вес 8 %; AA-LCR — 100 задач в три повтора, вес 6 %; GPQA Diamond — 198 вопросов в пять повторов, вес 6 %; CritPt — 70 задач в пять повторов, вес 6 %. Все модели идут в одинаковых условиях: температура (настройка, от которой зависит, насколько ответы разнятся от прогона к прогону) — 0 для обычных моделей и 0,6 для рассуждающих, запрос без примеров решения, счёт по схеме pass@1, то есть засчитывается только ответ с первой попытки. Снимок взят 30 августа 2026 года.
Arena, бывшая LMArena. Площадка выросла из проекта LMSYS в Университете Беркли. Посетитель пишет свой запрос, получает ответы двух моделей без названий и выбирает тот, который ему больше подходит; названия открываются только после голоса. Из накопленных голосов считается рейтинг в шкале Elo — это та самая оценка из слепых голосов, о которой сказано выше. Текстовый зачёт на снимке 27 августа 2026 года держится на 7 922 078 голосах и включает 395 моделей — это самая массовая из живых оценок.
Terminal-Bench 4.0. Проект поддержан Стэнфордом и Laude Institute, прогоны идут через открытую обвязку Harbor — программу, которая вокруг модели читает файлы и запускает команды. Модели дают доступ к терминалу и ставят задачу, результат проверяет набор тестов: задача либо решена, либо нет. Каждую связку прогоняют 330 раз, и рядом с точностью источник печатает половину ширины 95-процентного доверительного интервала — это число со знаком ±, разброс, в котором результат может гулять в обе стороны от напечатанного. Узкий интервал означает, что место установлено твёрдо; при широком строка может и не опережать соседей. Таблица создана 27 августа и обновлена 29 августа 2026 года.
Отраслевые арены той же площадки. WebDev Arena, где просят собрать работающую страницу или приложение, — снимок 21 августа 2026 года, 603 789 голосов, 121 модель. Text-to-Image Arena — снимок 25 августа 2026 года, 6 047 075 голосов, 76 моделей. Image Edit Arena, где голосующий даёт исходное изображение и указание, что в нём поменять, — отсечка голосов 25 августа 2026 года, 29 183 533 голоса, 53 модели. Text-to-Video Arena — отсечка 25 августа 2026 года, 645 773 голоса, 46 моделей. У Artificial Analysis по картинкам, правке и видео ведутся свои арены с собственным голосованием, все три сняты 30 августа 2026 года: в зачёте генерации картинок 158 моделей, в зачёте правки — 73, в зачёте роликов по описанию со звуком — 38.
Три оговорки меняют чтение таблиц, и без них числа понимаются неверно.
Terminal-Bench меряет связку «модель и обвязка», а не модель отдельно. Это видно прямо в названии строки: в таблице стоят «Claude Code с Opus 5», «Codex с GPT-5.6 Sol», «Grok Build с Grok 4.6». Сравнивать оттуда модели напрямую нельзя — сравниваются готовые рабочие сборки целиком.
Artificial Analysis не меряет русский язык. Индекс собран на англоязычных заданиях, а многоязычность у этого источника считается отдельным набором заданий на основе Global-MMLU-Lite, где русского в списке языков нет. Источник перечисляет английский, китайский, хинди, испанский, французский, арабский, бенгальский, португальский, индонезийский, японский, суахили, немецкий, корейский, итальянский, йоруба и бирманский. Ни одно число из текстового индекса к работе на русском отношения не имеет.
У русского разреза арены доверительные интервалы втрое шире, чем у общего зачёта. В общем зачёте это ±3…±5 очков, в русском — ±7…±32, потому что голосов по русскому в десять раз меньше: 804 885 против 7 922 078. У строк с числом голосов в несколько сотен разница между соседними местами внутри интервала неразличима, и подавать такой порядок как строгий рейтинг нельзя.
Лучшая нейросеть для текстов и переписки
Первое место в сводном индексе Artificial Analysis на снимке 30 августа 2026 года занимает Claude Opus 5 в режиме максимального усилия — 63,1 балла. Дальше идут Claude Fable 5 с 62,1 балла, GPT-5.6 Sol в режиме max с 60,9 и Grok 4.6 в режиме high тоже с 60,9. Разрыв между первой и четвёртой строкой — 2,2 балла, то есть верх таблицы плотный, и выбор внутри этой четвёрки решается ценой и скоростью, а не разницей в индексе.
| Модель | Разработчик | Индекс | Индекс по коду | GPQA Diamond, % | Цена вход, $/млн | Цена выход, $/млн | Скорость, ток/с | Выпуск |
|---|---|---|---|---|---|---|---|---|
| Claude Opus 5 (Max Effort) | Anthropic | 63,1 | 78,0 | 93,2 | 5 | 25 | 53 | 24.07.2026 |
| Claude Fable 5 (Max Effort) | Anthropic | 62,1 | 76,5 | 92,6 | 10 | 50 | 62 | 09.06.2026 |
| GPT-5.6 Sol (max) | OpenAI | 60,9 | 77,4 | 94,1 | 4 | 20 | 78 | 09.07.2026 |
| Grok 4.6 (high) | SpaceXAI | 60,9 | 76,8 | 94,9 | 2 | 6 | 59 | 12.08.2026 |
| Kimi K3 (max) | Kimi | 59,7 | 76,2 | 93,5 | 3 | 15 | 38 | 16.07.2026 |
| GLM-5.3 (max) | Z AI | 59,5 | 74,8 | 91,7 | 1,4 | 4,4 | 67 | 18.08.2026 |
| Qwen3.8 Max | Alibaba | 58,1 | 71,8 | 92,7 | 2 | 6 | 28 | 03.08.2026 |
| Gemini 3.7 Flash (high) | 56,0 | 76,1 | 94,5 | 0,75 | 3,75 | 330 | 13.08.2026 | |
| Claude Sonnet 5 (Max Effort) | Anthropic | 55,3 | 71,5 | 91,1 | 2 | 10 | 84 | 30.06.2026 |
| DeepSeek V4 Pro 0813 (Max Effort) | DeepSeek | 53,2 | 68,8 | 92,8 | 1,32 | 3,96 | 72 | 13.08.2026 |
| GPT-5.6 Luna (max) | OpenAI | 52,3 | 71,4 | 91,1 | 0,2 | 1,2 | 127 | 09.07.2026 |
Источник: Artificial Analysis, Intelligence Index v4.1.1, снимок 30 августа 2026 года. Цены в таблице — официальные ставки разработчиков за миллион токенов. Колонка GPQA Diamond — доля верных ответов на том наборе вопросов, который назван в составе индекса выше.
Колонка скорости объясняет, почему верх индекса не всегда совпадает с верхом рабочего удобства. Gemini 3.7 Flash при индексе 56,0 выдаёт 330 токенов в секунду — это в шесть с лишним раз быстрее Claude Opus 5 с его 53 токенами в секунду, и стоит вход у неё 0,75 доллара за миллион против пяти. На длинной переписке, где важна отзывчивость, разница в шесть баллов индекса ощущается слабее, чем разница в скорости ответа.
Слепое голосование людей даёт свой порядок, и он другой. В текстовом зачёте Arena на снимке 27 августа 2026 года первое место у claude-fable-5 с 1507 очками при интервале ±5 и 25 824 голосах; второе и третье — у claude-opus-4-6-high с 1505±4 на 72 104 голосах и claude-opus-4-7-high с 1502±4 на 60 136 голосах.
| Место | Модель | Разработчик и лицензия | Очки ± интервал | Голосов |
|---|---|---|---|---|
| 1 | claude-fable-5 | Anthropic, закрытая | 1507±5 | 25 824 |
| 2 | claude-opus-4-6-high | Anthropic, закрытая | 1505±4 | 72 104 |
| 3 | claude-opus-4-7-high | Anthropic, закрытая | 1502±4 | 60 136 |
| 4 | muse-spark-1.2 (xHigh) | Meta, закрытая | 1498±10 | 3 247 |
| 7 | claude-opus-5-high | Anthropic, закрытая | 1492±5 | 31 570 |
| 9 | gemini-3.7-flash-high | Google, закрытая | 1490±8, предварительная | 5 720 |
| 10 | kimi-k3-max | Moonshot, лицензия Kimi K3 | 1489±6 | 16 586 |
| 13 | gemini-3.1-pro-preview | Google, закрытая | 1487±3 | 101 163 |
| 15 | glm-5.3-max | Z.ai, MIT | 1484±8 | 5 820 |
| 16 | gpt-5.5-high | OpenAI, закрытая | 1482±4 | 61 604 |
| 17 | gpt-5.6-sol-xhigh | OpenAI, закрытая | 1482±5 | 21 537 |
| 19 | gemini-3.6-flash-high | Google, закрытая | 1481±5 | 20 190 |
Источник: Arena, Text Arena, снимок 27 августа 2026 года, 7 922 078 голосов, 395 моделей.
Расхождение двух таблиц объясняется тем, что они меряют разные вещи. Индекс собран из заданий с проверяемым ответом: решена задача в терминале или нет, угадан ответ на вопрос по физике или нет. Арена собирает предпочтение живого человека, который читает два ответа на свой собственный запрос и выбирает тот, что ему подходит. Первое отвечает на вопрос «справится ли модель с формальной задачей», второе — «понравится ли её ответ читателю». Обе оценки нужны, и обе годятся, просто отвечают они на разные вопросы.
Пометка «предварительная» у строки gemini-3.7-flash-high стоит от самого источника: голосов по ней пока 5 720, и площадка отдельно предупреждает, что оценка ещё уточняется. То же относится к строкам с интервалом ±10 и шире — у muse-spark-1.2 при 3 247 голосах интервал ±10, и её четвёртое место внутри этого интервала неотличимо от седьмого.
Полный разбор по типам текстов — посты, письма, продающие страницы, сценарии, работа с длинными документами — собран на отдельной странице про нейросети для написания текстов. Там же стоит разбор по подзадачам: какая модель ровнее держит заданную интонацию, а какая точнее следует структуре.
Цена той же работы в GEN202 считается за расход, а не за месяц. Вход Claude Opus 5 стоит 450 ₽ за миллион токенов, выход — 2250 ₽; у Claude Sonnet 5 это 180 ₽ и 900 ₽, у Claude Fable 5 — 900 ₽ и 4500 ₽. Семейство GPT-5.6 идёт тремя ступенями: Luna — 18 ₽ и 108 ₽, Terra — 180 ₽ и 1080 ₽, Sol — 450 ₽ и 2700 ₽. Gemini 3.6 Flash — 135 ₽ и 675 ₽, Grok 4.5 — 180 ₽ и 540 ₽. Самая доступная текстовая позиция начинается от 18 ₽ за миллион входных токенов.
Лучшая нейросеть для кода и программирования
Terminal-Bench 4.0 ставит задачу в терминале и проверяет результат тестами, поэтому здесь нет вкусовщины: задача либо решена, либо нет. На таблице, обновлённой 29 августа 2026 года, первое место у связки Claude Code с Opus 5 в режиме max — 51,82 % решённых задач при интервале ±3,39 на 330 прогонах. Вторая строка — Claude Code с Fable 5, 44,55 % при ±3,85. Третья — Claude Code с GLM-5.3, 41,82 % при ±3,23, и это модель с открытой лицензией MIT.
| Место | Сборка | Модель | Режим | Решено, % | Интервал, ± | Стоимость прогона, $ |
|---|---|---|---|---|---|---|
| 1 | Claude Code | Opus 5 | max | 51,82 | 3,39 | 5969 |
| 2 | Claude Code | Fable 5 | max | 44,55 | 3,85 | 7265 |
| 3 | Claude Code | GLM-5.3 | max | 41,82 | 3,23 | 2728 |
| 4 | Codex | GPT-5.6 Sol | max | 37,27 | 3,78 | 2542 |
| 5 | Claude Code | Opus 4.8 | max | 23,64 | 3,56 | 6481 |
| 6 | Codex | GPT-5.6 Terra | max | 21,52 | 3,25 | 1734 |
| 7 | Grok Build | Grok 4.6 | high | 20,30 | 3,09 | 3592 |
| 8 | Codex | GPT-5.6 Luna | max | 17,27 | 2,85 | 347 |
| 9 | Grok Build | Grok 4.5 | high | 12,42 | 2,62 | 2094 |
| 9 | Claude Code | Sonnet 5 | max | 12,42 | 3,06 | 9604 |
Источник: Terminal-Bench 4.0, таблица обновлена 29 августа 2026 года, 330 прогонов на каждую строку. Стоимость — суммарная цена всего прогона из 330 попыток, а не цена одной задачи.
Колонка стоимости показывает то, чего в проценте решённых задач не видно. Codex с GPT-5.6 Luna берёт 17,27 % задач за 347 долларов на весь прогон, а Claude Code с Sonnet 5 берёт 12,42 % за 9604 доллара — в двадцать семь с лишним раз дороже при меньшей доле решённых задач. Первое место обходится в 5969 долларов, третье — в 2728 при разнице в десять процентных пунктов. Выбор здесь строится не по верхней строке, а по соотношению доли решённых задач и цены прогона.
Сводная оценка по коду у Artificial Analysis собрана из двух прогонов — Terminal-Bench версии 2.1 на 89 задачах в три повтора и SciCode на 288 подзадачах в три повтора. На снимке 30 августа 2026 года верх этой колонки такой: GPT-5.6 Sol в режиме xhigh — 78,3, Claude Opus 5 в режиме max — 78,0, GPT-5.6 Sol в режиме max — 77,4, GPT-5.6 Sol в режиме high — 77,2, Grok 4.6 в режиме high — 76,8, GPT-5.6 Terra в режиме max — 76,7. Порядок здесь другой, чем в Terminal-Bench 4.0, и причина названа выше: в Terminal-Bench 4.0 в зачёт идёт сборка целиком вместе с обвязкой, а сводная оценка Artificial Analysis прогоняет модели в одинаковых условиях.
Отдельная колонка того же снимка — агентные задачи: Claude Opus 5 в режиме max — 59,2, GLM-5.3 в режиме max — 59,1, Grok 4.6 в режиме high — 58,7, Qwen3.8 Max — 58,4, GPT-5.6 Sol в режиме max — 57,8. Здесь модель с открытыми весами стоит на второй строке в десятых долях от первой.
Задача «собери работающий сайт или приложение» вынесена в WebDev Arena. На снимке 21 августа 2026 года при 603 789 голосах и 121 модели первое место у claude-opus-5-max — 1691 очко с интервалом ±9 на 8116 голосах. Второе — у kimi-k3-max с 1674±11, третье — у qwen3.8-max с 1669±13 и пометкой источника «предварительная оценка», четвёртое — у claude-opus-5-high с 1663±8. Сборка gpt-5.6-sol-xhigh в обвязке codex стоит седьмой с 1619±8 на 9499 голосах — это самое большое число голосов в верхней десятке.
Отдельно площадка публикует строки с пометкой «AutoEval»: оценка получена не живыми голосами, а автоматической процедурой, поэтому у них нет ни места в общем зачёте, ни числа голосов. Три верхние такие строки — glm-5.3-flash с 1634 под лицензией MIT, hy4-preview от Tencent с 1633 под Apache 2.0 и qwen3.8-flash-next с 1617 под общественной лицензией Alibaba.
Подробный разбор по видам работы — правка чужого кода, объяснение незнакомого файла, длинный репозиторий целиком, языки — стоит на странице про то, какая нейросеть лучше пишет код. Там же разобраны устаревшие зачёты по коду и то, почему в разных подборках разные победители.
Лучшая нейросеть для картинок: генерация с нуля
Artificial Analysis ведёт по картинкам собственную арену со слепым голосованием: оценивающему показывают два изображения по одному и тому же описанию, названия скрыты, сторона выбирается случайно и открывается только после голоса. Все изображения генерируются с настройками по умолчанию, в максимальном доступном разрешении, приводятся к 1024 на 1024, одно изображение на запрос, зерно генератора 42 — одно и то же начальное число для генератора, чтобы условия у всех моделей совпадали. Набор запросов обновляется каждый месяц. На снимке 30 августа 2026 года в зачёте 158 моделей.
| Место | Модель | Разработчик | Elo | Интервал, ± | Голосов | Доля побед, % | Цена, $ за 1000 изображений | Выпуск |
|---|---|---|---|---|---|---|---|---|
| 1 | GPT Image 2 (high) | OpenAI | 1369,8 | 10 | 14 868 | 65,2 | 211 | 21.04.2026 |
| 2 | MAI-Image-2.6-Preview | Microsoft AI | 1350,6 | 12 | 6 292 | 60,1 | цены нет | 10.08.2026 |
| 3 | Reve 2.1 | Reve | 1322,4 | 9 | 16 571 | 59,7 | 200 | 09.07.2026 |
| 4 | Nano Banana 2 | 1320,6 | 9 | 16 027 | 59,1 | 67 | 26.02.2026 | |
| 5 | GPT Image 1.5 (high) | OpenAI | 1306,3 | 9 | 14 330 | 55,2 | 133 | 16.12.2025 |
| 6 | MAI-Image-2.5 | Microsoft AI | 1302,5 | 9 | 15 057 | 55,2 | 48,128 | 02.06.2026 |
| 7 | Nano Banana Pro | 1296,5 | 9 | 14 517 | 54,0 | 134 | 20.11.2025 | |
| 9 | Nano Banana 2 Lite | 1288,5 | 9 | 14 808 | 54,2 | 33,6 | 30.06.2026 | |
| 11 | Seedream 5.0 Pro | ByteDance Seed | 1279,5 | 9 | 12 313 | 55,3 | 90 | 08.07.2026 |
| 23 | Ideogram 4.0 | Ideogram | 1219,7 | 9 | 8 178 | 49,3 | 60 | 03.06.2026 |
Источник: Artificial Analysis, Text to Image Arena, снимок 30 августа 2026 года.
Разница между первым местом и четвёртым — 49,2 очка Elo, а разница в цене между теми же строками трёхкратная: 211 долларов за тысячу изображений у GPT Image 2 против 67 у Nano Banana 2. Ещё дешевле Nano Banana 2 Lite — 33,6 доллара за тысячу при 1288,5 очка, то есть на 81,3 очка ниже первого места и в шесть с лишним раз дешевле его.
Вторая арена на той же теме даёт похожий верх и другие числа, потому что голосуют там другие люди и в другом объёме. На снимке 25 августа 2026 года при 6 047 075 голосах и 76 моделях первое место у gpt-image-2 в режиме medium — 1382 очка с интервалом ±4 на 75 014 голосах. Дальше mai-image-2.6-preview с 1331±8, grok-imagine-image-2.0 в режиме low с 1316±12 и пометкой «предварительная», reve-2.1 с 1302±8 и muse-image от Meta с 1281±6. Модель nano-banana-2 стоит седьмой с 1263±5 на 36 392 голосах, nano-banana-pro в режиме 2K — двенадцатой с 1245±3 на 146 806 голосах.
Строка ideogram-4.0-quality в этом же зачёте стоит пятнадцатой с 1204±5 на 36 647 голосах, и рядом с ней напечатана лицензия Ideogram Open Model. Двадцатое место занимает Cosmos3-Super-Text2Image от Nvidia с 1172±9 под лицензией OpenMDW-1.1.
Про Midjourney числа в этих таблицах есть, и читать их надо как историю вопроса. Самая свежая версия Midjourney в зачёте Artificial Analysis — v7 Alpha, выпуск 3 апреля 2025 года, 1093,1 очка и 97-е место; следом v6 с 1076,9 и v6.1 с 1058,1. Колонка цены у всех строк Midjourney пустая: цену доступа Midjourney публично не объявляет. Данные старше полугода не потому, что снимок старый, а потому, что новых версий в зачёт не поступало.
Полное сравнение генераторов по типам кадра — портрет, предметная съёмка, иллюстрация, текст внутри картинки — стоит на странице про то, какая нейросеть лучше рисует картинки.
Цена генерации в GEN202 считается за картинку и зависит от разрешения. У Nano Banana 2 это 7 ₽ за кадр в 1K, 11 ₽ в 2K и 14,5 ₽ в 4K. У Nano Banana Pro — 12 ₽ в 1K и 21,5 ₽ в 4K. У GPT Image 2 — 7 ₽ в 1K и 9,5 ₽ в 2K.
Лучшие нейросети для видео
Ролики меряются двумя зачётами сразу, и они не смешиваются: модели со звуком считаются отдельно от моделей без звука. В зачёте со звуком на снимке 30 августа 2026 года первое место у Wan 3.0 от Alibaba — 1242 очка с интервалом ±9 на 6254 голосах, при цене 12 долларов за минуту готового видео. Второе — у Gemini Omni Flash с 1237±6 на 17 933 голосах и ценой 6 долларов за минуту.
| Место | Модель | Разработчик | Elo | Интервал, ± | Голосов | Цена, $/мин | Выпуск |
|---|---|---|---|---|---|---|---|
| 1 | Wan 3.0 | Alibaba | 1242 | 9 | 6 254 | 12 | 19.08.2026 |
| 2 | Gemini Omni Flash | 1237 | 6 | 17 933 | 6 | 19.05.2026 | |
| 3 | Minimax H3 Max в сборке fal | Fal | 1235 | 10 | 5 342 | 2,4 | 26.08.2026 |
| 4 | MiniMax H3 | MiniMax | 1227 | 7 | 8 904 | 7,8 | 30.07.2026 |
| 5 | Dreamina Seedance 2.0 720p | ByteDance Seed | 1221 | 5 | 24 692 | 9,07 | 18.03.2026 |
| 9 | Kling 3.0 1080p (Pro) | KlingAI | 1108 | 5 | 22 352 | 20,16 | 04.02.2026 |
| 12 | Kling 3.0 720p (Standard) | KlingAI | 1100 | 5 | 21 459 | 15,12 | 04.02.2026 |
| 15 | Veo 3.1 | 1091 | 6 | 9 435 | 24 | 30.01.2026 | |
| 19 | Veo 3.1 Fast | 1086 | 5 | 20 163 | 9 | 30.01.2026 | |
| 22 | Sora 2 Pro | OpenAI | 1077 | 9 | 4 937 | 30 | 30.09.2025 |
Источник: Artificial Analysis, Text to Video Arena, зачёт со звуком, снимок 30 августа 2026 года, 38 моделей.
Тот же вопрос без звука даёт другую первую тройку: Gemini Omni Flash с 1324±9, MiniMax H3 с 1301±10 и HappyHorse-1.0 с 1283±8. В зачёте без звука 91 модель против 38 в зачёте со звуком, и порядок в нём свой. Разница объясняется тем, что голосующий, слыша звук, оценивает работу целиком, а без звука — только картинку и движение.
Слепое голосование Arena по роликам на отсечке 25 августа 2026 года при 645 773 голосах и 46 моделях ставит наверх gemini-omni-1.1-flash с 1515 очками, gemini-omni-flash с 1512 на 19 830 голосах и flux-3-video от Black Forest Labs с 1495. Модель dreamina-seedance-2.0-720p стоит четвёртой с 1479 на 51 266 голосах, minimax-h3 — шестой с 1460 под собственной общественной лицензией разработчика. Строки с ценой за секунду: sora-2-pro — 0,3 доллара, veo-3.1-audio — 0,5, veo-3.1-fast-audio — 0,15, grok-imagine-video-720p — 0,05.
Автоматический зачёт VBench к сегодняшним роликам применяется ограниченно, и это стоит назвать прямо: в его таблицы попадают только те модели, которые кто-то прогнал и прислал, поэтому свежих закрытых моделей 2026 года — Kling 3.0, Seedance 2.0, Veo 3.1, Sora 2, Hailuo — там нет. Самая свежая строка VBench 1.0 датирована 7 августа 2026 года, у VBench-2.0 — 1 апреля 2026 года. Набор Movie Gen Bench от Meta, который иногда приводят в сравнениях, опубликован вместе со статьёй, поданной 17 октября 2024 года, и содержит таблицы самой Meta: это заявление разработчика, а не независимый зачёт.
Полный разбор по семи видам работы с видео — ролик по описанию, ролик из фотографии, видео по образцам, правка готового ролика, продление, движение губ под звук, увеличение разрешения — стоит на странице про лучшие нейросети для видео. Там же собраны цены за минуту у всех разработчиков и медианное время одной генерации.
Секунда работы в GEN202: Kling 3.0 в 720p — 7,6 ₽, Seedance 2.0 в самом лёгком варианте — 6,5 ₽, Wan 2.7 по описанию в 720p — 9 ₽. Отдельной страницей идёт Veo 3.1 с выбором длительности 4, 6 или 8 секунд.
Лучшие нейросети для обработки фото
Правка готового снимка меряется отдельно от генерации с нуля, и лидеры там свои. Голосующий даёт исходное изображение и указание, что в нём поменять, получает два результата от моделей без названий и выбирает лучший. На отсечке голосов 25 августа 2026 года зачёт держится на 29 183 533 голосах и включает 53 модели — это самая массовая по числу голосов таблица из всех, что стоят на этой странице.
| Место | Модель | Организация | Elo | Интервал, ± | Голосов | Лицензия |
|---|---|---|---|---|---|---|
| 1 | gpt-image-2 (medium) | OpenAI | 1462 | 4 | 212 326 | закрытая |
| 2 | grok-imagine-image-2.0 (low) | SpaceXAI | 1439 | 8 | 5 936 | закрытая |
| 3 | mai-image-2.6-preview | Microsoft AI | 1417 | 7 | 9 013 | закрытая |
| 4 | muse-image | Meta | 1405 | 5 | 66 921 | закрытая |
| 6 | seedream-5.0-pro | Bytedance | 1395 | 4 | 129 749 | закрытая |
| 7 | gemini-3-pro-image-2k (Nano Banana Pro) | 1390 | 3 | 530 645 | закрытая | |
| 10 | gemini-3.1-flash-image (Nano Banana 2) | 1387 | 4 | 132 009 | закрытая | |
| 20 | hunyuan-image-3.0-instruct | Tencent | 1302 | 3 | 307 683 | общественная Tencent |
| 25 | gemini-2.5-flash-image-preview (Nano Banana) | 1293 | 2 | 11 120 036 | закрытая | |
| 31 | qwen-image-edit | Alibaba | 1241 | 3 | 1 981 055 | Apache 2.0 |
Источник: Arena, Image Edit Arena, отсечка голосов 25 августа 2026 года.
Своя арена по правке есть и у Artificial Analysis: на снимке 30 августа 2026 года в ней 73 модели, и первое место занимает Riverflow 2.0 от Sourceful с 1286,2 очка на 9362 голосах при доле побед 66,1 % и цене 150 долларов за тысячу изображений. Второе место — MAI-Image-2.6-Preview с 1283,7, третье — MAI-Image-2.5-Pro с 1272,2. GPT Image 2 в режиме high стоит здесь пятым с 1259,2 на 26 081 голосе, Nano Banana 2 — восьмой с 1250,9 при цене 67 долларов за тысячу, Nano Banana Pro — десятой с 1245,5.
Две арены по одной теме ставят наверх разные модели, и это нормальный результат, а не ошибка одной из них: у площадок разная аудитория, разный набор исходных снимков и разные указания на правку. Строка gpt-image-2 в первой таблице держится на 212 326 голосах, строка Riverflow 2.0 во второй — на 9362; при таком разрыве в объёме голосов сравнивать очки между двумя таблицами нельзя, они считаются каждая в своей шкале.
Разбор по видам правки — сохранение лица между кадрами, фотореалистичный свет и кожа, правка нескольких кадров разом, увеличение разрешения старого снимка, удаление фона, восстановление старой фотографии — стоит на странице про нейросети для обработки фото.
Лучшие нейросети на русском языке
Самый весомый замер по русскому — тот же слепой зачёт Arena, отфильтрованный по языку запроса. Отдельного набора заданий там нет: это живой поток запросов, из которого отобраны русскоязычные. На снимке 27 августа 2026 года в русском разрезе 804 885 голосов и 359 моделей.
| Место | Разброс места | Модель | Разработчик | Очки ± интервал | Голосов |
|---|---|---|---|---|---|
| 1 | 1–10 | claude-fable-5 | Anthropic | 1519±12 | 2 547 |
| 2 | 1–26 | gemini-3.7-flash-high | 1517±24, предварительная | 616 | |
| 3 | 1–42 | muse-spark-1.2 (xHigh) | Meta | 1512±32 | 329 |
| 4 | 1–21 | claude-opus-4-7-high | Anthropic | 1507±9 | 6 055 |
| 5 | 1–21 | claude-opus-4-6 | Anthropic | 1507±7 | 8 227 |
| 7 | 1–26 | gemini-3-pro | 1501±9 | 4 791 | |
| 8 | 1–31 | claude-opus-5-high | Anthropic | 1500±11 | 3 392 |
| 9 | 2–26 | gemini-3.1-pro-preview | 1499±7 | 10 833 | |
| 13 | 2–42 | gpt-5.6-sol-xhigh | OpenAI | 1492±13 | 2 233 |
| 19 | 2–49 | gemini-3.6-flash-high | 1487±13 | 2 088 | |
| 22 | 2–52 | qwen3.8-max | Alibaba | 1485±16 | 1 361 |
Источник: Arena, Text Arena с фильтром Russian, снимок 27 августа 2026 года.
Колонка «разброс места» здесь важнее колонки места. Она приходит от самого источника и показывает, в каком диапазоне модель может находиться с учётом неопределённости. У первой строки это места с первого по десятое, у второй — с первого по двадцать шестое при 616 голосах и интервале ±24. То есть верх русского зачёта — это группа примерно из десятка моделей, внутри которой порядок статистически не установлен, а не строгая лестница от первого места к двадцать второму.
Рассуждение на русском меряет живая таблица MERA Reason, обновлённая 30 июля 2026 года. Задания там русские и проверяемые: ruAIME — 724 олимпиадные задачи AIME 1983–2025 годов на русском со сверкой точного ответа; T-math — 310 задач Всероссийской и Московской олимпиад 2005–2025 годов; Luzitania — 251 задание на многошаговое рассуждение; MMReD — рассуждение на длинном тексте, пять типов вопросов на трёх длинах контекста 32, 64 и 128 тысяч токенов, всего 750 вопросов. Примеров решения в запросе нет.
| Место | Модель | Общий балл | ruAIME | T-math | Luzitania | MMReD |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.8 | 80,82 | 98,48 | 78,18 | 58,96 | 93,97 |
| 2 | gemma-4-31B-it | 73,94 | 95,03 | 78,83 | 43,43 | 91,86 |
| 3 | Qwen3.5-122B-A10B | 67,36 | 86,88 | 72,64 | 35,06 | 93,07 |
| 4 | Qwen3.5-27B | 65,54 | 87,71 | 69,38 | 31,47 | 96,36 |
| 5 | GLM-5 | 63,80 | 90,06 | 67,10 | 29,48 | 93,01 |
| 8 | DeepSeek-v4-Pro | 60,18 | 88,67 | 67,43 | 23,11 | 94,94 |
Источник: MERA Reason, таблица обновлена 30 июля 2026 года, всего 24 модели. Российских моделей — GigaChat, YandexGPT, T-Pro, Cotype — в этой таблице нет.
Колонка Luzitania объясняет, зачем такой набор нужен. У первой строки там 58,96 при 98,48 на олимпиадных задачах: многошаговое рассуждение на русском даётся моделям заметно тяжелее, чем математика с точным ответом, и разрыв между этими двумя колонками виден у всех строк таблицы.
Основной русскоязычный зачёт MERA сейчас читается как история вопроса. Сайт проекта отдаёт заглушку о технических работах, живых чисел с него снять нельзя; сохранился снимок из веб-архива за 11 апреля 2026 года, и он старше полугода. В том снимке первое место у Claude-Opus-4.6 с общим баллом 0,862 при 0,925 на наборе ruMMLU, вторая строка — Human Benchmark, результат живого человека на тех же заданиях, 0,852. Третье место у GPT-5.4 с 0,821, тринадцатое — у GigaChat-3.1-Ultra с 0,712. Методика MERA устроена так, что прогоны присылают сами команды, и в таблице есть колонка с тем, кто прислал замер: строка Claude Opus 4.5 с баллом 0,763 и строка GPT-5.2 с баллом 0,707 присланы самими разработчиками.
Единственная таблица, где зарубежные и российские модели померены одинаково, — российская арена llmarena.ru, и её снимок датирован 18 апреля 2026 года, то есть тоже относится к истории вопроса. В нём 104 модели и 132 622 голоса; верх занимают Gemini 3 Pro Preview с 1210 очками, Gemini Pro 2.5 Preview с 1196 и GPT-5.4 с 1187, а российские модели идут ниже: Alice AI LLM от Яндекса — 1083 очка, T-pro-it-2.0 от Т-Банка — 1036, GigaChat 2 Max от Сбера — 999, YandexGPT 5.1 Pro — 997. Голосов там на порядок меньше, чем в русском разрезе Arena, поэтому интервалы у верхних строк доходят до ±39, и сам источник ставит нескольким моделям подряд одинаковый ранг.
Подробный разбор российских и зарубежных моделей на русском языке — на странице про лучшие нейросети на русском. Там же разобрано, что делать с расхождением составов: у четырёх русскоязычных источников модели почти не пересекаются, поэтому числа сравнимы только внутри одной таблицы.
Какая нейросеть лучше: выбор модели под вид результата
Зачёты выше отвечают на вопрос «кто наверху в этой дисциплине». Рабочий вопрос устроен наоборот: сначала называется результат, который нужен на выходе, и уже под него берётся модель. Ниже пять видов результата и работа на русском языке поверх них, а у каждой строки — модели из каталога GEN202 и страница серии, где эта задача разобрана отдельно.
Текст, переписка и разбор документа. Из каталога первую строку сводного индекса занимает Claude Opus 5, а слепое голосование людей на текстах выигрывает Claude Fable 5; рядом с ними стоят Claude Sonnet 5, три ступени GPT-5.6, Gemini 3.6 Flash и Grok 4.5. Длинная статья, короткий рекламный текст, переписывание готового и работа с большой пачкой исходников разведены по отдельным разделам на странице нейросети для написания текстов.
Код, работа в терминале и сборка страницы. Верх зачёта в терминале держит сборка Claude Code с Opus 5, и это та же модель, которая в каталоге зовётся Claude Opus 5; ту же работу берут GPT-5.6 и Claude Sonnet 5. Чем правка чужого файла отличается от написания с нуля и что меняется на большом репозитории, разобрано на странице лучшая нейросеть для кода.
Картинка с нуля по описанию. Эту работу в каталоге берут GPT Image 2, Nano Banana 2 и Nano Banana Pro — все три стоят в верхней части арены картинок. Кто из них точнее держит фотореализм, следует описанию и повторяет фирменный стиль, показано на странице лучшая нейросеть для картинок.
Правка готового снимка. Работа устроена не так, как генерация с нуля: к запросу прикладывается исходная фотография, а словами задаётся только то, что в ней меняется. Из каталога наверх зачёта по правке выходит GPT Image 2, в первой десятке того же зачёта стоят Nano Banana Pro и Nano Banana 2. Виды правки разведены по отдельным зачётам на странице нейросети для обработки фото.
Ролик. В каталоге ролики делают Kling 3.0, Seedance 2.0, Wan 2.7 и Veo 3.1. Выбор здесь начинается не с имени модели, а с того, что подаётся на вход: одно описание словами, готовая фотография или уже снятый ролик. Под каждый вход в зачётах стоит свой состав участников, и разбор по ним собран на странице лучшие нейросети для видео.
Запрос и ответ на русском языке. Русский стоит поверх остальных пяти задач: по-русски пишется и статья, и описание кадра, и постановка задачи по коду. Из каталога первую строку русского разреза занимает Claude Fable 5, в том же зачёте идут Claude Opus 5 и Gemini 3.6 Flash. Чем модель берёт на русском и как в русских замерах выглядят российские модели, разобрано на странице лучшие нейросети на русском.
Одна работа редко сводится к одному виду результата. У статьи с иллюстрациями текст пишет одна модель, а кадры рисует другая; у карточки товара снимок сначала правится, а потом из него делается ролик. Поэтому выбор по этому списку делается не один раз, а столько раз, сколько разных результатов нужно получить.
Лучшие бесплатные нейросети: открытые веса и лицензии
Лицензия модели напечатана в тех же таблицах, рядом с рейтингом, и по этой колонке модели с открытыми весами видно сразу. Открытые веса означают, что модель можно скачать и запустить на своём оборудовании, а лицензия говорит, на каких условиях это разрешено. Ниже — строки с открытыми лицензиями из уже разобранных зачётов, с их местами и датами снимков.
Текст. В зачёте Arena на снимке 27 августа 2026 года glm-5.3-max от Z.ai стоит на пятнадцатом месте с 1484±8 под лицензией MIT, kimi-k3-max от Moonshot — на десятом с 1489±6 под собственной лицензией Kimi K3. В сводном индексе Artificial Analysis на снимке 30 августа 2026 года GLM-5.3 в режиме max набирает 59,5 балла — это девятая строка индекса при цене 1,4 доллара за миллион входных токенов и 4,4 за миллион выходных. GLM-5.3-Flash в том же индексе даёт 57,5 балла при цене 0,15 и 0,5 доллара, Qwen3.8-Flash-Next — 55,8 балла при 0,15 и 0,47.
Код. Claude Code с GLM-5.3 занимает третье место Terminal-Bench 4.0 с 41,82 % решённых задач на таблице от 29 августа 2026 года, и стоимость прогона у неё 2728 долларов против 5969 у первого места. В WebDev Arena на снимке 21 августа 2026 года glm-5.3-max стоит восьмым с 1599±15, qwen3.8-27b от Alibaba под лицензией Apache 2.0 — девятым с 1595±13 на 2464 голосах, deepseek-v4-pro-high от 13 августа 2026 года под MIT — двенадцатым с 1582±12, deepseek-v4-flash-high под MIT — тринадцатым с 1579±11. Строки с автоматической оценкой: glm-5.3-flash под MIT — 1634, hy4-preview от Tencent под Apache 2.0 — 1633, qwen3.8-flash-next под общественной лицензией Alibaba — 1617.
Картинки. В зачёте Arena на снимке 25 августа 2026 года ideogram-4.0-quality стоит пятнадцатым с 1204±5 на 36 647 голосах под лицензией Ideogram Open Model, Cosmos3-Super-Text2Image от Nvidia — двадцатым с 1172±9 под OpenMDW-1.1.
Правка снимка. На отсечке 25 августа 2026 года qwen-image-edit от Alibaba стоит тридцать первым с 1241±3 под Apache 2.0 и держится на 1 981 055 голосах. Версия qwen-image-edit-2511 стоит тридцать второй с 1235±3 под той же лицензией, hunyuan-image-3.0-instruct от Tencent — двадцатой с 1302±3 под общественной лицензией Tencent.
Видео. В зачёте Arena на отсечке 25 августа 2026 года minimax-h3 стоит шестым с 1460 очками под собственной общественной лицензией разработчика.
Общая картина по всем пяти зачётам одна: модели с открытыми весами держатся в верхней трети, а в коде и в агентных задачах доходят до второй-третьей строки. GLM-5.3 в агентной колонке Artificial Analysis набирает 59,1 при 59,2 у первого места — разница в одну десятую балла. Счёт за работу такой модели через чужой сервис при этом идёт своим порядком: открытая лицензия снимает плату за саму модель, а оборудование, на котором она считает, оплачивается отдельно.
Полные списки открытых моделей по каждой задаче с их местами разобраны на страницах серии: по видео — в разделе про модели с открытыми весами на странице лучшие нейросети для видео, по правке снимков — на странице нейросети для обработки фото, по коду — на странице лучшая нейросеть для кода.
Лучшая нейросеть онлайн: порядок работы в окне браузера
Онлайн здесь означает, что модель открывается в браузере и ставить на компьютер ничего не нужно: задание пишется в поле, ответ приходит на ту же страницу. Врезка на этой странице и полный чат с нейросетью собраны из одного каталога, поэтому список моделей у них общий, а разговор сквозной: начатое во врезке находится в чате в списке разговоров.
Порядок один на все виды работы и состоит из трёх шагов. Сначала над полем ввода выбирается модель: сперва семейство, потом версия внутри него. Затем задаются настройки, если они у модели есть, — у рисующих это разрешение и формат кадра, у видеомоделей к ним добавляется длительность. После этого пишется задание, и вместе с ним уходит свой файл, когда он нужен.
Вложение меняет смысл задания. Без файла рисующая модель собирает кадр с нуля по описанию, а с приложенной фотографией она правит то, что на снимке уже есть, и словами задаётся только изменение. Что приходит в ответ, зависит от вида модели: текстовая возвращает текст прямо в окне, рисующая — готовый кадр, видеомодель — ролик.
Такой же чат стоит внизу каждой страницы серии, и открывается он сразу на модели под задачу этой страницы. На странице нейросети для написания текстов в поле уходит кусок вашей статьи, и чат там открыт на Claude Fable 5. На странице лучшая нейросеть для кода отправляют фрагмент, который надо разобрать или переписать, и чат открыт на Claude Opus 5. На страницах лучшая нейросеть для картинок и нейросети для обработки фото стоит Nano Banana 2: на первой отправляется описание кадра, на второй — свой снимок вложением. Страница лучшие нейросети для видео открывает чат на Kling 3.0, страница лучшие нейросети на русском — на Claude Fable 5.
Лучшие нейросети без регистрации: чат прямо на странице
Чат внизу этой страницы отвечает сразу: выберите модель в списке над полем ввода, напишите задание и получите ответ — первая работа идёт за счёт сервиса. В списке стоят те же модели, что разобраны выше: GPT-5.6 тремя ступенями, Claude Opus 5, Claude Sonnet 5, Claude Fable 5, Gemini 3.6 Flash, Grok 4.5, а также рисующие модели Nano Banana 2, Nano Banana Pro и GPT Image 2.
Такой порядок работы отвечает на запрос про сравнение своими руками: одну и ту же задачу можно отправить в две-три модели подряд и посмотреть, чем ответы отличаются на вашем материале. Числа зачётов показывают среднее по большой выборке чужих запросов, а ваш запрос — один и конкретный, и на нём порядок моделей вполне может оказаться другим.
Больше моделей, история разговоров и вложения — в полном чате с нейросетью. Ключ для доступа к тем же моделям из своей программы выпускается в кабинете и работает со всем каталогом сразу: API языковых моделей и каталог показывают полный состав.
Как читать чужие рейтинги и сравнения нейросетей
Подборки в поиске часто перечисляют сервисы, а не сравнивают их, и вывод в такой подборке зависит от четырёх условий сразу. Проверка любого чужого рейтинга сводится к тому, чтобы эти четыре условия найти.
Дата снимка и версия модели. Рейтинги двигаются, поэтому дата — часть факта, а не оформление. Разница между версиями внутри одного семейства бывает больше, чем разница между семействами: в зачёте Terminal-Bench 4.0 на 29 августа 2026 года Claude Code с Opus 5 берёт 51,82 % задач, а Claude Code с Opus 4.8 — 23,64 %, то есть вдвое меньше. В таблицах Artificial Analysis рядом с каждой моделью стоит дата выпуска, и по ней видно, о каком поколении идёт речь: Claude Opus 5 выпущен 24 июля 2026 года, GPT-5.6 Sol — 9 июля, Grok 4.6 — 12 августа, Gemini 3.7 Flash — 13 августа, GLM-5.3 — 18 августа.
Режим работы модели. У одной и той же модели в таблице стоит несколько строк, потому что уровень усилия меняет результат. Claude Opus 5 в режиме максимального усилия даёт 63,1 балла индекса, в режиме high — 61,5, в режиме medium — 58,6, в режиме low — 52,5. Разброс внутри одной модели здесь — 10,6 балла, больше, чем расстояние от первого места до девятого. Ссылка на «Claude Opus 5» без указания режима не определяет число.
Кто и как считает. Слепое голосование людей, автоматический прогон с проверкой тестами и оценка модели-судьи дают три разных ответа. В аренах голосуют люди и оценка складывается из десятков тысяч сравнений; в Terminal-Bench результат проверяют тесты, и субъективности там нет вовсе; в зачётах по правке изображений оценку часто ставит другая модель, и это надо называть прямо. У GEditBench v2 роль судьи выполняет GPT-4o версии 26-03-24 вместе с собственным судьёй авторов, у GenArena — Qwen3-VL-32B. Такой замер полезен, но он измеряет и предпочтения судьи тоже.
Кто опубликовал числа. Публикация разработчика о собственной модели — не независимый замер, и в честной подборке это помечается. Набор Movie Gen Bench существует только в статье самой Meta, поданной 17 октября 2024 года, и общей таблицы с чужими результатами у него нет. Замеры GenEval и DPG-Bench по картинкам живой общей таблицы тоже не имеют: числа публикуются внутри статей о конкретных моделях, то есть прогон делают авторы очередной модели, а настройки генерации и версии оценивающих моделей у разных авторов различаются. Складывать такие строки из разных статей в один список нельзя.
Какие зачёты уже стали историей. Часть популярных названий продолжает жить в подборках, хотя свежих данных за ними нет. У SWE-bench последняя заявка в таблице датирована 26 февраля 2026 года. У Aider polyglot последний прогон — 3 октября 2025 года, и моделей 2026 года там нет вообще; в файле таблицы 69 записей с датами от 21 декабря 2024 года. У LiveCodeBench публичные данные обрываются на мае 2025 года, в файле 28 моделей, и самые свежие участники относятся к уровню o3-mini. VBench не содержит свежих закрытых моделей 2026 года. Сайт MERA закрыт на технические работы, доступен только снимок из архива за 11 апреля 2026 года. Российская арена llmarena.ru пересчитана 18 апреля 2026 года. Все эти замеры годятся как история вопроса и не годятся как ответ на вопрос «что сейчас».
Что видно на живой работе, чего не видно в рейтинге
Elo показывает, какой ответ люди выбирают чаще, но не показывает, как модель ведёт себя в длинной работе: что она возвращает вместо результата, где спотыкается и что делает со второй попытки. Это видно в разборах, где автор прогоняет две модели через одинаковые рабочие задания и показывает экран. Такие наблюдения не заменяют зачёт, но объясняют его.
Автор канала «ИИ работает за тебя» прогнал GPT-5.5 и Claude Opus 4.7 через одинаковые рабочие задания: посадочную страницу, копию чужого сайта по снимку экрана, приложение для учёта финансов, трёхмерную игру и разбор большого отчёта маркетплейса. Его вывод касается не качества ответа, а удобства: новичку на недорогом тарифе проще ChatGPT, потому что всё собрано в одном окне, а на дорогом тарифе он выбирает Claude. Обе названные версии стоят в текстовом зачёте Arena на снимке 27 августа 2026 года: claude-opus-4-7-high — третьей строкой с 1502±4, gpt-5.5-high — шестнадцатой с 1482±4.
Англоязычный автор Eliot Prince провёл через Claude Opus 4.6 и ChatGPT в режиме Pro производство целого выпуска для видеоплощадки — от исследования темы до сценария, обложки и кода панели с данными. Его наблюдение о характере ответов: Claude вытягивает из исследования анализ и историю, а ответы ChatGPT ближе к шаблону. В том же зачёте Arena claude-opus-4-6-high стоит второй строкой с 1505±4 на 72 104 голосах.
Автор канала Parker Prompts сравнивал ChatGPT 5.4 и Gemini 3.1 Pro и развёл их по размеру задачи: короткие скрипты у ChatGPT запускаются с первого раза, а Gemini устойчивее держит большую кодовую базу за счёт длинного контекста. Ответ ChatGPT 5.4 он назвал структурным и логичным, но плоским по интонации. Обе версии есть в снимке Arena от 27 августа 2026 года: gemini-3.1-pro-preview — тринадцатая строка с 1487±3 на 101 163 голосах, gpt-5.4-high — двадцать третья с 1477±4 на 60 614 голосах.
Автор канала Ruben давал ChatGPT 5.3 и Gemini 3.1 Pro бытовые задания: сочувственный ответ, рецепт по фотографии с подвохом, разбор незнакомого аппарата по видео, вопрос про размер мебели и багажника, выбор наушников. Оставить одну модель он предпочёл бы Gemini за сочетание скорости и точности, признав при этом, что на текстах, данных и коде впереди ChatGPT. Колонка скорости в индексе Artificial Analysis это подтверждает числами: Gemini 3.7 Flash выдаёт 330 токенов в секунду при 56,0 балла индекса, тогда как Claude Opus 5 — 53 токена в секунду при 63,1 балла.
Развёрнутые сопоставления этих пар с задачами и ограничениями каждой стороны собраны отдельно: Claude или ChatGPT, Gemini или ChatGPT и GPT-5.6 или Claude Fable 5. Разбор трёх моделей Claude между собой — на странице про то, какую модель Claude выбрать.
Лучшие нейросети для работы: сводная таблица по задачам
Таблица собирает верхние строки всех зачётов в одном месте — по ней выбор делается без чтения всей страницы. Числа в ней разного рода: баллы индекса, проценты решённых задач и Elo — оценка из слепых голосов людей. Знак ± рядом с Elo — доверительный интервал, разброс, в котором оценка может гулять. Сравниваются числа только внутри одной строки.
| Работа | Кто наверху и с каким числом | Кто рядом по цене | Зачёт и дата снимка |
|---|---|---|---|
| Длинный текст, разбор документа | Claude Opus 5 — 63,1 балла | GLM-5.3 — 59,5 балла при 1,4 и 4,4 $/млн | Artificial Analysis, индекс v4.1.1, 30.08.2026 |
| Ответ, который читает живой человек | claude-fable-5 — 1507±5 | gemini-3.6-flash-high — 1481±5 | Arena, Text Arena, 27.08.2026 |
| Быстрый ответ в переписке | Gemini 3.7 Flash — 330 токенов в секунду | GPT-5.6 Luna — 127 токенов в секунду | Artificial Analysis, индекс v4.1.1, 30.08.2026 |
| Задача в терминале целиком | Claude Code с Opus 5 — 51,82 % | Claude Code с GLM-5.3 — 41,82 % за 2728 $ прогона | Terminal-Bench 4.0, 29.08.2026 |
| Собрать сайт или приложение | claude-opus-5-max — 1691±9 | qwen3.8-27b — 1595±13, Apache 2.0 | Arena, WebDev Arena, 21.08.2026 |
| Картинка с нуля по описанию | GPT Image 2 (high) — 1369,8 | Nano Banana 2 — 1320,6 при 67 $ за 1000 | Artificial Analysis, Text to Image, 30.08.2026 |
| Правка готового снимка | gpt-image-2 (medium) — 1462±4 | qwen-image-edit — 1241±3, Apache 2.0 | Arena, Image Edit, 25.08.2026 |
| Ролик по описанию со звуком | Wan 3.0 — 1242±9 при 12 $/мин | Minimax H3 Max в сборке fal — 1235±10 при 2,4 $/мин | Artificial Analysis, Text to Video, 30.08.2026 |
| Ролик без звука | Gemini Omni Flash — 1324±9 | MiniMax H3 — 1301±10 | Artificial Analysis, Text to Video, 30.08.2026 |
| Запрос на русском языке | claude-fable-5 — 1519±12 | gemini-3.6-flash-high — 1487±13 | Arena, фильтр Russian, 27.08.2026 |
| Рассуждение на русском | Claude Opus 4.8 — 80,82 | gemma-4-31B-it — 73,94 | MERA Reason, 30.07.2026 |
Колонка «кто рядом по цене» показывает, что верх зачёта и разумный выбор — это часто разные строки. Разница между первой и третьей строкой Terminal-Bench 4.0 составляет десять процентных пунктов, а разница в стоимости прогона — больше чем вдвое. Разница между первым и четвёртым местом в зачёте картинок — 49,2 очка, а разница в цене — трёхкратная.
Сколько стоит работа тех же моделей в GEN202
GEN202 даёт доступ к моделям из таблиц выше по одному ключу и одному счёту в рублях. Каталог собран из 64 моделей от 15 поставщиков, у 23 из них есть своя страница с описанием и ценами, а строк с ценой в каталоге 142, потому что цену задаёт не модель, а выбранный у неё вариант: разрешение, длительность, режим. Разница с ценой разработчика по каждому варианту стоит отдельной колонкой в таблице на странице цен и пересчитывается вместе с каталогом.
Счёт ведётся в кредитах: один кредит равен 0,005 доллара по внутреннему счёту, розничная цена кредита — 0,50 рубля. Пополнение начинается от 500 ₽, новому счёту начисляется 50 кредитов, то есть 25 ₽. Остаток кредитов переносится с месяца на месяц и сохраняется на балансе.
Текстовые модели считаются за токены. Ставки за миллион: GPT-5.6 Luna — 18 ₽ на вход и 108 ₽ на выход; GPT-5.6 Terra — 180 ₽ и 1080 ₽; GPT-5.6 Sol — 450 ₽ и 2700 ₽; Gemini 3.6 Flash — 135 ₽ и 675 ₽; Grok 4.5 — 180 ₽ и 540 ₽; Claude Opus 5 — 450 ₽ и 2250 ₽; Claude Sonnet 5 — 180 ₽ и 900 ₽; Claude Fable 5 — 900 ₽ и 4500 ₽.
Картинки считаются за генерацию: Nano Banana 2 — 7 ₽ за кадр в 1K и 14,5 ₽ в 4K, Nano Banana Pro — 12 ₽ в 1K, GPT Image 2 — 7 ₽ в 1K. Ролики считаются за секунду: Kling 3.0 в 720p — 7,6 ₽, Seedance 2.0 в лёгком варианте — 6,5 ₽, Wan 2.7 по описанию в 720p — 9 ₽.
Один ключ работает со всем каталогом сразу: смена модели — это замена одного идентификатора в поле запроса. Полный состав с ценами — в каталоге, текстовые модели отдельно — на странице API языковых моделей, общее описание работы через один ключ — на странице про агрегатор нейросетей.
Оплата идёт рублями с карты российского банка, счёт выставляет российский продавец. Сумма к оплате складывается из выполненных вызовов. Подробности про доступ к зарубежным моделям из России собраны на странице нейросети в России.
Лучшие нейросети 2026: как проверить, что список не устарел
Проверка чужой подборки занимает три шага, и все три сводятся к датам.
- Найдите дату снимка у каждого числа. Числа на этой странице сняты в диапазоне с 21 по 30 августа 2026 года: WebDev Arena — 21 августа, зачёты картинок, правки и видео у Arena — 25 августа, текстовый зачёт Arena и его русский разрез — 27 августа, Terminal-Bench 4.0 — 29 августа, все зачёты Artificial Analysis — 30 августа, MERA Reason — 30 июля. У подборки без дат проверить актуальность нельзя в принципе.
- Сверьте даты выпуска моделей. Даты выпуска стоят отдельной колонкой в снимке Artificial Analysis от 30 августа 2026 года. Модели, которые сейчас стоят наверху, выпущены в 2026 году: Claude Sonnet 5 — 30 июня, Claude Opus 5 — 24 июля, Claude Fable 5 — 9 июня, GPT-5.6 всех трёх ступеней — 9 июля, Grok 4.6 — 12 августа, Gemini 3.7 Flash — 13 августа, GLM-5.3 — 18 августа, Wan 3.0 — 19 августа, GPT Image 2 — 21 апреля, Nano Banana 2 — 26 февраля. Подборка, где верхние строки заняты моделями прошлого поколения, описывает прошлый год.
- Посмотрите на число голосов и ширину интервала. Строка с доверительным интервалом ±24 на 616 голосах и строка с интервалом ±3 на 101 163 голосах — это разные по надёжности утверждения, даже если очков у них поровну: у первой оценка гуляет в восемь раз шире. Площадки помечают предварительные оценки сами, и эта пометка переносится в честную подборку вместе с числом.
Даты и число голосов у каждого зачёта на этой странице стоят рядом с таблицей, поэтому проверить любую строку можно по первоисточнику.
Частые вопросы
Какая нейросеть самая лучшая? Самой лучшей в общем зачёте нет, и это видно по таблицам: в сводном индексе Artificial Analysis на 30 августа 2026 года наверху Claude Opus 5 с 63,1 балла, в слепом голосовании Arena на 27 августа — claude-fable-5 с 1507 очками, в задачах терминала на 29 августа — сборка Claude Code с Opus 5 с 51,82 % решённых задач, в картинках на 30 августа — GPT Image 2 с 1369,8 очка, а в роликах со звуком — Wan 3.0 с 1242. Пять зачётов, четыре разных имени наверху. Рабочий подход — выбрать модель под свою основную задачу по её зачёту и проверить её на своём материале.
Какая нейросеть лучше для работы? Отталкивайтесь от вида результата. Длинный текст и разбор документа — верх сводного индекса, там Claude Opus 5 с 63,1 балла и Claude Fable 5 с 62,1. Быстрый ответ в переписке — колонка скорости, там Gemini 3.7 Flash с 330 токенами в секунду. Задача в терминале и правка репозитория — Terminal-Bench 4.0, там Claude Code с Opus 5 берёт 51,82 % задач. Сборка страницы или приложения — WebDev Arena, там claude-opus-5-max с 1691 очком. Картинка для материала — GPT Image 2 с 1369,8 очка или Nano Banana 2 с 1320,6 при цене вчетверо ниже.
Лучшие бесплатные нейросети — какие из них есть в зачётах? Модели с открытыми весами стоят в тех же таблицах, и лицензия напечатана рядом с рейтингом. Под MIT выложены GLM-5.3 и GLM-5.3-Flash от Z.ai, DeepSeek V4 Pro и V4 Flash. Под Apache 2.0 — Qwen3.8 27B, hy4-preview от Tencent, qwen-image-edit и qwen-image-edit-2511. Под собственными общественными лицензиями идут Kimi K3 от Moonshot, HunyuanImage 3.0 Instruct от Tencent и MiniMax H3. Места у них высокие: GLM-5.3 — третья строка Terminal-Bench 4.0 с 41,82 %, Kimi K3 — вторая строка WebDev Arena с 1674 очками, MiniMax H3 — шестая строка зачёта роликов Arena с 1460.
Лучшая русская нейросеть — как её выбрать? Смотрите на русский разрез Arena от 27 августа 2026 года: там 804 885 голосов и колонка «разброс места», которая честно показывает неопределённость. Первая строка — claude-fable-5 с 1519±12, вторая — gemini-3.7-flash-high с 1517±24 на 616 голосах. Для рассуждения на русском есть живая таблица MERA Reason от 30 июля 2026 года, где первое место у Claude Opus 4.8 с общим баллом 80,82. Российские модели в этих двух таблицах не участвуют; единственный источник, где зарубежные и российские модели померены одинаково, — llmarena.ru со снимком от 18 апреля 2026 года, и он относится к истории вопроса.
Топ лучших нейросетей из подборок в поиске — им можно верить? Проверяйте три вещи: стоит ли у чисел дата снимка, названы ли версии моделей с датами выпуска и указано ли, кто проводил замер. Публикация разработчика о собственной модели — не независимый зачёт, и в фактуре этой страницы такие случаи помечены прямо: Movie Gen Bench существует только в статье Meta от 17 октября 2024 года, а числа GenEval и DPG-Bench публикуются внутри статей о конкретных моделях, потому что живой общей таблицы у них нет.
Почему в разных сравнениях разные победители? Потому что зачёты меряют разное. Сводный индекс собран из заданий с проверяемым ответом, арена собирает предпочтение живого человека, Terminal-Bench проверяет результат тестами, а зачёты по правке изображений используют модель-судью. Плюс у моделей есть режимы: Claude Opus 5 даёт 63,1 балла в режиме максимального усилия и 52,5 в режиме low — разброс внутри одной модели больше, чем расстояние от первого места до девятого.
Можно ли сравнить несколько моделей на одной и той же задаче? Да, для этого достаточно чата на этой странице: выберите модель над полем ввода, отправьте задание, затем поменяйте модель и отправьте то же самое. Один ключ GEN202 работает со всем каталогом, поэтому ту же проверку можно сделать из своей программы, поменяв один идентификатор в поле запроса. Счёт при этом общий и в рублях.
Лучшие нейросети 2026 — где смотреть подробности по каждой задаче? По каждой задаче на сайте стоит отдельный разбор: тексты, код, картинки, обработка фото, видео и русский язык. В каждом разборе — полные таблицы зачётов, разрезы по подзадачам и цены.
Чат с нейросетью онлайн
ChatGPT, Claude, Gemini, Grok, Nano Banana и другие нейросети — в одном окне, прямо в браузере. Выберите нужную в списке над полем ввода и напишите задание: первая работа идёт за счёт сервиса. Больше моделей и история разговоров — в чате с нейросетью.