Лучшие нейросети для написания текстов видны в двух свежих зачётах, и меряют эти зачёты разное. Arena считает слепые голоса живых людей: человек пишет свой запрос, получает два ответа без названий моделей и выбирает тот, который ему больше подходит. Из тысяч таких голосов складывается одно число на модель — рейтинг по шкале Elo, придуманной когда-то для шахматистов: чем он выше, тем чаще люди выбирают ответы этой модели. Рядом с рейтингом источник печатает доверительный интервал — разброс, внутри которого число может гулять в обе стороны; чем интервал уже, тем надёжнее место модели в таблице. Artificial Analysis прогоняет модели сама через их общедоступные программные интерфейсы и складывает результат девяти проверяемых заданий в один индекс. Ниже обе таблицы с датами снимков, отдельный зачёт по русскому языку и разбор по работам: длинная статья, короткий рекламный текст, переписывание готового текста, письма и переписка, большой объём исходников. Рядом с каждой моделью из каталога GEN202 стоит её цена за миллион токенов в рублях: токены — куски слов, которыми модели считают объём работы, и счёт идёт отдельно за отправленный текст и отдельно за полученный ответ.
Попробуйте Claude Fable 5, GPT-5.6 и Gemini 3.6 Flash — чат с нейросетью онлайн и без регистрации, ниже на странице.
Коротко: какая нейросеть лучше всего пишет тексты
Верх зачёта по слепым голосам людей занимает Claude Fable 5 — 1507 очков при доверительном интервале ±5 и 25 824 сравнениях с её участием (Arena, Text Arena, снимок 27 августа 2026 года). Следом стоят Claude Opus 4.6 в режиме high с 1505 ±4 и Claude Opus 4.7 в режиме high с 1502 ±4. Интервалы этих трёх строк перекрываются, поэтому порядок внутри тройки зачёт не разделяет: он говорит, что эти три модели стоят выше остальных, а не какая из них первая.
Сводный индекс Artificial Analysis выстраивает те же модели иначе. Первое место у Claude Opus 5 в режиме максимального усилия — 63,1 балла, дальше тот же Opus 5 в режиме xhigh с 62,5, Claude Fable 5 с 62,1, GPT-5.6 Sol в режиме max с 60,9 и Grok 4.6 в режиме high с теми же 60,9 (Artificial Analysis, Intelligence Index v4.1.1, дата забора 30 августа 2026 года).
Русскоязычные голоса дают третий порядок. В том же зачёте Arena с фильтром по русскому языку первой стоит Claude Fable 5 с 1519 ±12, второй — Gemini 3.7 Flash в режиме high с 1517 ±24, третьей — Muse Spark 1.2 в режиме xHigh с 1512 ±32 (снимок 27 августа 2026 года). Интервалы здесь втрое шире общего зачёта, и сам источник печатает рядом с местом диапазон: у первой строки это места с первого по десятое, у второй — с первого по двадцать шестое.
Три ответа на один вопрос получаются потому, что зачёты меряют разную работу и разную аудиторию. Дальше каждый разобран отдельно: что именно он проверяет, какая у него методика и где проходит граница его применимости. Затем идёт разбор по типам текстовой работы — под каждую из них верхняя строка своя.
Как читать зачёты: что меряет каждый из них
Arena устроена как слепое сравнение. Посетитель приносит собственный запрос, получает ответы двух моделей, названия которых скрыты, выбирает подходящий и только после голоса видит, кто это был. Из этих голосов складывается рейтинг по шкале Elo. На дату снимка 27 августа 2026 года в общем зачёте 7 922 078 голосов и 395 моделей. Из всех разобранных здесь замеров этот ближе всего к вопросу «чей текст читается лучше», потому что оценку ставит читатель, а не проверочный набор.
Artificial Analysis работает иначе: компания сама прогоняет модели и считает сводный индекс из девяти заданий, взвешенных по четырём группам — агентные задачи 34 %, код 24 %, научное рассуждение 24 %, общие знания 18 %. Агентными называют задания, где модель работает по шагам сама: ищет, запускает инструменты, проверяет себя и доводит дело до результата. Каждое имя в списке ниже — отдельный набор заданий со своим составителем, а процент рядом с ним — вес этого набора в общем индексе. Состав индекса опубликован полностью: GDPval-AA v2 — 220 задач с одним повтором и весом 20 %; Terminal-Bench v2.1 — 89 задач по три повтора, вес 16 %; 𝜏³-Banking — 97 задач по пять повторов, вес 14 %; AA-Omniscience — 6000 задач, вес 12 %; Humanity’s Last Exam — 2158 задач, вес 12 %; SciCode — 288 подзадач по три повтора, вес 8 %; AA-LCR — 100 задач по три повтора, вес 6 %; GPQA Diamond — 198 вопросов по пять повторов, вес 6 %; CritPt — 70 задач по пять повторов, вес 6 %. Все модели идут в одинаковых условиях: температура 0 для обычных и 0,6 для рассуждающих — температурой называют настройку разброса ответов, и чем она ниже, тем предсказуемее модель отвечает, — запрос без примеров решения и счёт по схеме pass@1: засчитывается только ответ с первой попытки, второй попытки модели не дают.
Отсюда следует главное при чтении этой таблицы применительно к текстам. Ни одно из девяти заданий не проверяет письмо: индекс собран из агентной работы, кода, научного рассуждения и знаний. Высокое место в нём означает, что модель сильна в рассуждении и в доведении задачи до конца, — это влияет на структуру и на связность длинного материала, но напрямую качество слога не меряет.
Второе ограничение источник называет сам: индекс собран на англоязычных заданиях. Многоязычность Artificial Analysis меряет отдельным набором на основе Global-MMLU-Lite, и русского в списке его языков нет — перечислены английский, китайский, хинди, испанский, французский, арабский, бенгальский, португальский, индонезийский, японский, суахили, немецкий, корейский, итальянский, йоруба и бирманский. Ни одно число из индекса не описывает работу модели на русском. Для человека, который пишет по-русски, это означает простую вещь: сводный индекс читается как оценка мышления модели, а ответ про русский текст берётся из русского разреза арены и из русскоязычных наборов заданий, разобранных ниже.
Топ нейросетей для текста по слепым голосам людей
Ниже верх общего зачёта Arena. Источник — таблица зачёта Text Arena, снимок 27 августа 2026 года, 7 922 078 голосов, 395 моделей. Пометка «предварительно» стоит там, где источник считает число голосов пока недостаточным.
| Место | Модель | Разработчик | Оценка ± 95 % ДИ | Голосов |
|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 1507 ±5 | 25 824 |
| 2 | Claude Opus 4.6 (high) | Anthropic | 1505 ±4 | 72 104 |
| 3 | Claude Opus 4.7 (high) | Anthropic | 1502 ±4 | 60 136 |
| 4 | Muse Spark 1.2 (xHigh) | Meta | 1498 ±10 | 3 247 |
| 5 | Claude Opus 4.6 | Anthropic | 1497 ±3 | 76 079 |
| 6 | Claude Opus 4.7 | Anthropic | 1494 ±4 | 61 282 |
| 7 | Claude Opus 5 (high) | Anthropic | 1492 ±5 | 31 570 |
| 8 | Muse Spark 1.1 | Meta | 1490 ±5 | 22 215 |
| 9 | Gemini 3.7 Flash (high) | 1490 ±8, предварительно | 5 720 | |
| 10 | Kimi K3 Max | Moonshot | 1489 ±6 | 16 586 |
| 11 | Muse Spark | Meta | 1488 ±6 | 13 574 |
| 12 | Claude Opus 5 (max) | Anthropic | 1488 ±6 | 15 398 |
| 13 | Gemini 3.1 Pro Preview | 1487 ±3 | 101 163 | |
| 14 | Gemini 3 Pro | 1486 ±4 | 40 674 | |
| 15 | GLM-5.3 Max | Z.ai | 1484 ±8 | 5 820 |
| 16 | GPT-5.5 (high) | OpenAI | 1482 ±4 | 61 604 |
| 17 | GPT-5.6 Sol (xhigh) | OpenAI | 1482 ±5 | 21 537 |
| 18 | Claude Opus 4.8 (high) | Anthropic | 1481 ±4 | 46 773 |
| 19 | Gemini 3.6 Flash (high) | 1481 ±5 | 20 190 | |
| 20 | Qwen3.8 Max | Alibaba | 1479 ±6 | 11 780 |
Читается таблица по трём признакам сразу. Первый — плотность: между первым и двадцатым местом 28 очков, а доверительные интервалы у большинства строк от ±3 до ±6. Соседние строки внутри такого разброса зачёт не различает, и говорить о победителе по разнице в одно-два очка нельзя.
Второй признак — состав верха. Восемь из двадцати строк заняты моделями Anthropic, причём в разных режимах усилия: Opus 4.6 стоит и в режиме high, и в обычном, и это две отдельные строки с разными числами. Режим — часть ответа: одна и та же модель на разных уровнях усилия получает разную оценку.
Третий признак — число голосов. У Claude Opus 4.6 в зачёте 76 079 сравнений, у Gemini 3.1 Pro Preview — 101 163, а у Muse Spark 1.2 всего 3 247, и интервал у неё сразу ±10. Строка с тремя тысячами голосов и строка со ста тысячами стоят рядом, но опираются на разный объём наблюдений.
У той же таблицы зачёта есть отдельные разрезы — подсчёты голосов по одному виду запросов, — всего их двадцать девять, и среди них творческое письмо, следование инструкции, многоходовой разговор, длинный запрос, сложные запросы и профессиональные задачи, а также разбивка по языкам. Эти разрезы отвечают на вопросы уже, чем общий зачёт, и человек, который выбирает модель под свой тип текста, смотрит именно на них.
Лучшие нейросети для генерации текста по сводному индексу
Таблица ниже — верх снимка Artificial Analysis на 30 августа 2026 года, таблица зачёта моделей. Скорость и время до первого токена меряются отдельным набором: запрос примерно на 10 000 входных токенов, восемь прогонов в сутки, публикуется медиана за последние 72 часа. У рассуждающих моделей первым идёт токен рассуждения, поэтому время до первого токена у них большое, и сравнивать по этой колонке рассуждающую модель с обычной некорректно. Две колонки с процентами — доли верных ответов на двух наборах из состава индекса: GPQA Diamond с вопросами по естественным наукам и HLE — так сокращают Humanity’s Last Exam из того же списка выше.
| Место | Модель | Индекс | GPQA Diamond, % | HLE, % | Скорость, ток/с | До первого токена, с |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 (max) | 63,1 | 93,2 | 54,9 | 53 | 51,1 |
| 2 | Claude Opus 5 (xhigh) | 62,5 | 93,7 | 54,4 | 52 | 24,5 |
| 3 | Claude Fable 5 (max) | 62,1 | 92,6 | 55,5 | 62 | 94,5 |
| 4 | Claude Opus 5 (high) | 61,5 | 93,7 | 52,8 | 52 | 18,5 |
| 5 | GPT-5.6 Sol (max) | 60,9 | 94,1 | 49,5 | 78 | 120,4 |
| 6 | Grok 4.6 (high) | 60,9 | 94,9 | 42,9 | 59 | 40,3 |
| 8 | Kimi K3 (max) | 59,7 | 93,5 | 46,9 | 38 | 4,0 |
| 9 | GLM-5.3 (max) | 59,5 | 91,7 | 42,3 | 67 | 1,6 |
| 13 | Qwen3.8 Max | 58,1 | 92,7 | 43,0 | 28 | 2,6 |
| 18 | GPT-5.6 Terra (max) | 56,6 | 92,5 | 42,9 | 114 | 146,6 |
| 19 | Gemini 3.7 Flash (high) | 56,0 | 94,5 | 47,9 | 330 | 9,1 |
| 21 | Grok 4.5 (high) | 55,8 | 93,1 | 42,7 | 53 | 12,2 |
| 23 | Claude Sonnet 5 (max) | 55,3 | 91,1 | 41,3 | 84 | 199,9 |
| 25 | DeepSeek V4 Pro (max) | 53,2 | 92,8 | 41,0 | 72 | 1,6 |
| 29 | GPT-5.6 Luna (max) | 52,3 | 91,1 | 39,5 | 127 | 168,0 |
Разброс внутри одной модели здесь больше, чем разница между семействами. У Claude Opus 5 в снимке пять строк с разными уровнями усилия, и общий индекс меняется от 63,1 в режиме max до 52,5 в режиме low — десять с половиной баллов на одной и той же модели. Выбирая модель под текст, вы выбираете и режим, в котором она будет работать.
Скорость расходится с индексом ещё сильнее. Gemini 3.7 Flash в режиме high выдаёт 330 токенов в секунду при индексе 56,0, а Qwen3.8 Max — 28 токенов в секунду при индексе 58,1: почти двенадцатикратная разница в скорости при разнице в два балла. Для длинного текста, который вы читаете целиком после генерации, скорость почти не важна; для переписки, где ответ читают по мере появления, она решает всё.
Лучшие нейросети для текста на русском
Русский разрез Arena — тот же поток живых запросов и те же слепые голоса, отобранные по языку. На снимке 27 августа 2026 года в нём 804 885 голосов и 359 моделей, страница разреза открыта. Колонка «разброс места» — из самого источника: она показывает, в каком диапазоне мест модель может находиться с учётом неопределённости.
| Место | Разброс места | Модель | Разработчик | Оценка ± 95 % ДИ | Голосов |
|---|---|---|---|---|---|
| 1 | 1–10 | Claude Fable 5 | Anthropic | 1519 ±12 | 2 547 |
| 2 | 1–26 | Gemini 3.7 Flash (high) | 1517 ±24, предварительно | 616 | |
| 3 | 1–42 | Muse Spark 1.2 (xHigh) | Meta | 1512 ±32 | 329 |
| 4 | 1–21 | Claude Opus 4.7 (high) | Anthropic | 1507 ±9 | 6 055 |
| 5 | 1–21 | Claude Opus 4.6 | Anthropic | 1507 ±7 | 8 227 |
| 6 | 1–22 | Claude Opus 4.6 (high) | Anthropic | 1506 ±8 | 7 792 |
| 7 | 1–26 | Gemini 3 Pro | 1501 ±9 | 4 791 | |
| 8 | 1–31 | Claude Opus 5 (high) | Anthropic | 1500 ±11 | 3 392 |
| 9 | 2–26 | Gemini 3.1 Pro Preview | 1499 ±7 | 10 833 | |
| 10 | 2–29 | Claude Opus 4.7 | Anthropic | 1498 ±9 | 6 219 |
| 12 | 1–45 | Claude Opus 5 (max) | Anthropic | 1493 ±15 | 1 604 |
| 13 | 2–42 | GPT-5.6 Sol (xhigh) | OpenAI | 1492 ±13 | 2 233 |
| 15 | 2–42 | Gemini 3.5 Flash (high) | 1491 ±11 | 3 327 | |
| 17 | 4–38 | GPT-5.4 (high) | OpenAI | 1490 ±8 | 6 507 |
| 19 | 2–49 | Gemini 3.6 Flash (high) | 1487 ±13 | 2 088 | |
| 22 | 2–52 | Qwen3.8 Max | Alibaba | 1485 ±16 | 1 361 |
Числа здесь читаются осторожнее, чем в общем зачёте, и причина названа источником. Голосов по русскому в десять раз меньше, чем всего, поэтому доверительные интервалы у верхних строк от ±7 до ±32 против ±3…±5 в общем зачёте. У Muse Spark 1.2 в русском разрезе 329 голосов и интервал ±32 — такая строка сообщает, что модель попала в верхнюю часть таблицы, и не сообщает ничего о том, третья она или сороковая. Отсюда практическое правило: из русского разреза берётся не порядок мест, а состав верхней группы.
Состав этой группы устойчив. Claude Fable 5 стоит первой и в общем зачёте, и в русском; модели Anthropic занимают семь строк из шестнадцати, Google — пять, причём Gemini 3.7 Flash в русском разрезе поднимается на второе место, а в общем стоит девятым. Верх русского разреза делят Anthropic и Google, дальше идут OpenAI и Alibaba.
Одно расхождение в самом источнике стоит назвать прямо. Рядом с датой страница печатает 804 885 голосов, а сумма по строкам во внутренних данных той же страницы даёт 1 170 032. Здесь используется то, что печатает сама страница; построчные числа — оценки, интервалы и голоса по каждой модели — в обоих способах совпали до единицы.
Русскоязычные сервисы, их тарифы и условия входа разобраны на отдельной странице — лучшие нейросети на русском.
Рассуждение на русском: живой зачёт MERA Reason
MERA Reason — русскоязычный набор заданий, который ведёт Альянс в сфере ИИ, а таблица зачёта работает и обновляется. Каждое имя ниже — отдельный набор заданий внутри него. ruAIME — 724 задачи американской математической олимпиады AIME за 1983–2025 годы, переведённые на русский, засчитывается только точное совпадение ответа с эталоном. T-math — 310 задач Всероссийской и Московской олимпиад за 2005–2025 годы, ответ засчитывается, если он математически равен эталонному, даже когда записан иначе. Luzitania — 251 задание, где к ответу надо прийти в несколько шагов рассуждения. MMReD — вопросы по длинному тексту, ответ на которые приходится собирать из разных его мест: пять типов вопросов на трёх длинах контекста (32, 64 и 128 тысяч токенов), всего 750 вопросов. Задания даются без примеров решения, а результат выражен долей выполненных заданий в процентах. Дата снимка — 30 июля 2026 года, таблица зачёта на HuggingFace.
| # | Модель | Общий балл | ruAIME | T-math | Luzitania | MMReD |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.8 | 80,82 | 98,48 | 78,18 | 58,96 | 93,97 |
| 2 | gemma-4-31B-it | 73,94 | 95,03 | 78,83 | 43,43 | 91,86 |
| 3 | Qwen3.5-122B-A10B | 67,36 | 86,88 | 72,64 | 35,06 | 93,07 |
| 4 | Qwen3.5-27B | 65,54 | 87,71 | 69,38 | 31,47 | 96,36 |
| 5 | GLM-5 | 63,80 | 90,06 | 67,10 | 29,48 | 93,01 |
| 6 | Qwen3.5-35B-A3B | 61,82 | 88,81 | 66,45 | 27,89 | 88,75 |
| 7 | Qwen3.6-27B | 61,02 | 91,71 | 65,47 | 25,10 | 91,96 |
| 8 | DeepSeek-v4-Pro | 60,18 | 88,67 | 67,43 | 23,11 | 94,94 |
| 9 | DeepSeek-v4-Flash | 56,03 | 86,88 | 61,89 | 22,71 | 80,69 |
| 10 | Qwen3.6-35B-A3B | 55,43 | 88,54 | 65,15 | 18,73 | 87,41 |
Для текстовой работы интересна прежде всего колонка MMReD: она проверяет рассуждение по длинному русскому тексту, а это ровно то, что делает человек, когда просит модель разобрать документ и написать по нему материал. Порядок в ней отличается от общего балла: выше всех Qwen3.5-27B с 96,36 при четвёртом месте в зачёте, дальше DeepSeek-v4-Pro с 94,94 при восьмом месте и Claude Opus 4.8 с 93,97. Всего в таблице 24 модели, российских среди них нет.
История вопроса: MERA и llmarena.ru
Два русскоязычных замера сохранились, но описывают прошлое, и держать их надо именно так — как историю вопроса, а не ответ на «что сейчас».
Основная таблица зачёта MERA — набор из 23 задач на русском, включая ruMMLU на 14 012 вопросов с выбором ответа и задания ЕГЭ. На 30 августа 2026 года сайт целиком отдаёт сообщение о технических работах, живых чисел с него снять нельзя. Доступен снимок из веб-архива за 11 апреля 2026 года: первое место у Claude Opus 4.6 с 0,862 по шкале от нуля до единицы, второе — у строки «человек», которую MERA публикует как точку отсчёта, с 0,852, третье у GPT-5.4 с 0,821. Российские модели в том снимке стоят так: BerryLM-v2 от Wildberries и Russ — 0,81, Cotype Light 3 от MWS AI — 0,792, GigaChat-3.1-Ultra — 0,712. Особенность методики называется прямо: прогоны присылают сами команды, и часть строк прислана разработчиками моделей.
Вторая таблица — llmarena.ru, российская арена со слепым голосованием, единственный найденный источник, где зарубежные и российские модели померены одинаково. Снимок пересчитан 18 апреля 2026 года: 104 модели, 132 622 голоса. Верх занимает Gemini 3 Pro Preview с 1210 очками, выше всех из российских стоит Alice AI LLM с 1083 на одиннадцатом месте, дальше T-pro-it-2.0 от Т-Банка с 1036, GigaChat 2 Max с 999 и YandexGPT 5.1 Pro с 997. Голосов там на порядок меньше, чем в русском разрезе Arena, а интервалы у верхних строк от ±20 до ±39 — сам источник ставит нескольким моделям подряд одинаковый ранг, показывая, что верхние места статистически неразличимы.
Длинная статья: лучшая нейросеть для написания статей
Длинная статья упирается в две измеримые величины: сколько текста модель напишет за один ответ и сколько этот ответ стоит. По каталогу GEN202 предел ответа такой: у трёх уровней GPT-5.6 и у трёх моделей Claude — до 128 000 токенов, у Gemini 3.6 Flash — до 64 000. У Grok 4.5 предел ответа поставщик не называет.
Цена выхода у текстовых моделей выше цены входа, а на статье вы платите в основном за выход: вход — это план и материалы, выход — весь текст. Официальные цены разработчиков за миллион выходных токенов такие: 1,2 доллара у GPT-5.6 Luna, 12 у GPT-5.6 Terra, 30 у GPT-5.6 Sol, 7,5 у Gemini 3.6 Flash, 6 у Grok 4.5, 25 у Claude Opus 5, 10 у Claude Sonnet 5 и 50 у Claude Fable 5. Ставка GEN202 на текст ниже официальной ровно на десять процентов, и в рублях это 108 ₽ за миллион выходных токенов у GPT-5.6 Luna против 4500 ₽ у Claude Fable 5.
Из зачётов к длинному материалу ближе всего две вещи. В сводном индексе Artificial Analysis есть отдельная составляющая AA-LCR — сто задач по три повтора с весом 6 % в индексе, и её вклад входит в общий балл каждой строки таблицы выше. В Arena среди двадцати девяти разрезов заведены отдельно длинный запрос и творческое письмо: голоса по ним считаются отдельно от общего зачёта.
Верх обоих зачётов на длинной работе сходится на одном семействе. Claude Opus 5 в режиме max берёт первое место по индексу с 63,1 балла, Claude Fable 5 — первое место по слепым голосам с 1507 очками. При этом разница в цене между ними двукратная: официально 5 и 25 долларов за миллион у Opus 5 против 10 и 50 у Fable 5.
Короткий рекламный текст: скорость и цена ответа
Короткий текст пишется десятками вариантов подряд, поэтому здесь считается не место в зачёте, а скорость ответа и цена одного прогона. По снимку Artificial Analysis от 30 августа 2026 года быстрее всех отвечает Gemini 3.7 Flash — 330 токенов в секунду в режиме high и 332 в режиме medium при времени до первого токена 9,1 и 4,7 секунды. Дальше идут GPT-5.6 Luna со 127 токенами в секунду, GPT-5.6 Terra со 114 и Claude Sonnet 5 с 84.
Время до первого токена у моделей с рассуждением большое по устройству замера: считается время до первого токена вообще, а у них первым идёт токен рассуждения. Поэтому у Claude Sonnet 5 в режиме max в таблице стоит 199,9 секунды, а у Claude Opus 5 в режиме medium — 4,0. Одна и та же модель на разных уровнях усилия отвечает по-разному, и для коротких заданий берётся нижний уровень.
Цена короткого текста считается по выходу, и разница между ступенями каталога здесь та же, что на длинном материале: миллион выходных токенов у GPT-5.6 Luna стоит 108 ₽, у Gemini 3.6 Flash — 675 ₽, у Claude Sonnet 5 — 900 ₽. Разница между ступенями видна не на одном заголовке, а на потоке однотипных объявлений.
Переписывание готового текста: лучшие нейросети для работы с текстом
Переписывание устроено обратно написанию с нуля: на вход идёт готовый текст, иногда вместе с примерами нужного тона, на выход — тот же объём или меньше. Поэтому здесь смотрят на цену входа. Самый дешёвый вход в каталоге у GPT-5.6 Luna — 18 ₽ за миллион входных токенов при официальной цене разработчика 0,2 доллара. Дальше Gemini 3.6 Flash с 135 ₽, затем Claude Sonnet 5 и Grok 4.5 с одинаковым входом 180 ₽.
Из измеренного к этой работе относится разрез Arena по следованию инструкции: правка чужого текста — это задание с рамками, где важно не отойти от заданного. Голоса по этому разрезу считаются отдельно, и он стоит в списке двадцати девяти категорий таблицы зачёта рядом с творческим письмом и многоходовым разговором.
Общий зачёт для правки берётся с поправкой на то, что он меряет. Слепые голоса собраны на любых запросах, а не только на переписывании, поэтому верхняя строка Arena отвечает на вопрос «чей ответ чаще выбирают», а не «кто точнее держит заданные рамки». Проверка на своём материале снимает этот вопрос за один прогон: один и тот же абзац отправляется в две-три модели, и разница видна сразу.
Письма и переписка: чем отличается многоходовой разговор
Переписка отличается от одиночного задания тем, что предыдущие сообщения отправляются заново при каждом обращении: модель прошлый разговор не помнит, и вся история идёт во вход. Отсюда два следствия. Первое — на длинной переписке растёт доля входных токенов, и цена входа становится важнее цены выхода. Второе — время до первого токена ощущается сильнее, чем в любой другой работе, потому что ответ ждут прямо сейчас.
Числа для выбора берутся из того же снимка Artificial Analysis. Самое короткое время до первого токена в верхней части таблицы у GLM-5.3-Flash — 1,5 секунды, у GLM-5.3 в режиме max — 1,6, у DeepSeek V4 Pro — 1,6, у Qwen3.8 Max — 2,6, у Qwen3.8-Flash-Next — 2,7. Из моделей каталога GEN202 короче всех отвечает Claude Opus 5: 3,4 секунды в режиме low и 4,0 в режиме medium; у GPT-5.6 Sol в режиме medium — 4,7 секунды, у Grok 4.5 в режиме high — 12,2.
Многоходовой разговор вынесен в Arena отдельным разрезом, и это ровно тот случай, когда общий зачёт и разрез расходятся: модель, которая пишет сильный одиночный ответ, не обязательно так же держит нить на двадцатом сообщении. Как устроен счёт за переписку и что именно попадает во вход, разобрано отдельно — миллион токенов: сколько это текста.
Большой объём исходников: лучшие нейросети для больших текстов
Работа по чужим материалам упирается в окно контекста — сколько текста модель принимает за один запрос. По каталогу GEN202 картина такая: у трёх уровней GPT-5.6 окно 1 050 000 токенов, у трёх моделей Claude и у Gemini 3.6 Flash — 1 000 000, у Grok 4.5 — 500 000.
Вторая величина — порог, за которым включается повышенная ставка. У трёх уровней GPT-5.6 он стоит на 272 000 входных токенов и срабатывает строго выше порога: официальная цена Luna меняется с 0,2 и 1,2 доллара на 0,4 и 1,8, у Terra — с 2 и 12 на 4 и 18, у Sol — с 5 и 30 на 10 и 45. У Grok 4.5 порог 200 000 токенов и включается с самого порога: 2 и 6 долларов становятся 4 и 12. У Gemini 3.6 Flash и у всех трёх моделей Claude второй ступени нет — ставка одна на любой длине запроса.
Измеренная сторона этой работы — колонка MMReD в MERA Reason: 750 вопросов по длинному русскому тексту на трёх длинах контекста, включая 128 тысяч токенов. Порядок там свой: Qwen3.5-27B — 96,36, DeepSeek-v4-Pro — 94,94, Claude Opus 4.8 — 93,97, Qwen3.5-122B-A10B — 93,07, GLM-5 — 93,01 (снимок 30 июля 2026 года). В общем зачёте MERA Reason эти же модели стоят иначе: Claude Opus 4.8 первый с 80,82, а Qwen3.5-27B четвёртый с 65,54. Разница объясняется составом: общий балл складывается из четырёх наборов, два из которых — олимпиадная математика, а MMReD меряет только работу с длинным текстом.
Практический порядок работы с большим объёмом исходников остаётся прежним при любой модели: факты, цифры и цитаты из готового текста сверяются с исходником до публикации. Текст, собранный по чужому документу, выглядит одинаково уверенно независимо от того, из той ли части документа он собран.
Бесплатные нейросети для текстов: модели с открытой лицензией
Лицензия записана в самом зачёте Arena рядом с названием модели. Открытая лицензия означает, что веса модели — файлы обученной сети — выложены и её разрешено скачать и запустить на своём оборудовании. В верхних двадцати строках открытая лицензия стоит у двух:
- GLM-5.3 Max от Z.ai под лицензией MIT: 1484 ±8 очка и пятнадцатое место в общем зачёте Arena, 59,5 балла сводного индекса Artificial Analysis, официальная цена 1,4 и 4,4 доллара за миллион токенов.
- Kimi K3 Max от Moonshot под собственной лицензией Kimi K3: 1489 ±6 и десятое место Arena, 59,7 балла индекса.
Самые низкие официальные ставки в снимке Artificial Analysis — у моделей, которые в верхнюю тридцатку арены не вошли: GLM-5.3-Flash с 57,5 балла индекса стоит 0,15 и 0,5 доллара за миллион токенов при времени до первого токена 1,5 секунды, Qwen3.8-Flash-Next с 55,8 балла — 0,15 и 0,47 доллара при 83 токенах в секунду, DeepSeek V4 Pro с 53,2 балла — 1,32 и 3,96 доллара. Последняя в MERA Reason занимает восьмое место с 60,18 и держит 94,94 на длинном русском тексте.
Снимки: Arena — 27 августа 2026 года, Artificial Analysis — 30 августа 2026 года, MERA Reason — 30 июля 2026 года.
Попробовать модель, не пополняя счёт, можно в чате на этой странице: первый ответ идёт за счёт сервиса, без регистрации.
Что видно на живой работе: разборы с одинаковыми заданиями
Зачёт складывает тысячи голосов и прогонов в одно число. Разбор с одинаковыми заданиями показывает другое: как модель понимает формат, укладывается ли в жанр и что делает, когда задание можно понять двумя способами. Ниже наблюдения двух авторов, которые давали моделям одни и те же задания и показывали результат на экране. Версии моделей там прошлого поколения, и относятся эти наблюдения к поведению, а не к местам в таблицах.
Формат короткого поста. В русскоязычном разборе канала «Нейросети для экспертов с Анастасией Тарасовой» четыре сервиса писали пост для телеграм-канала по одинаковому заданию. Текст, который автор назвала готовым к публикации, вышел у ChatGPT; Grok, по её словам, выдал материал, тянущий на статью, и она предположила, что модель не знает принятых для телеграма норм длины. DeepSeek написал коротко и просто, Алиса собрала пост из пяти правил, и формат автору понравился. Отсюда рабочий приём: площадка, предельный объём в знаках и то, чем текст заканчивается, называются прямо в задании.
Выполнимость сценария. В том же разборе на задании «сценарий вертикального ролика» автор отметила у Grok цепляющий, но сложный в производстве вариант, а сценарий ChatGPT назвала структурным и лёгким для исполнения и взяла его себе для продвижения ролика. Работу Алисы она описала как сценарий короткометражки, за съёмку которого, по её словам, ни один эксперт не возьмётся.
Буквальность понимания задания. В англоязычном разборе канала Skill Leap AI GPT-5.5 и Claude Opus 4.7 получали одинаковые задания, а оценки выставляла посторонняя модель Gemini, а не автор ролика. На задании «собери посадочную страницу» ChatGPT вернул текст для неё, а Claude написал текст и собрал саму страницу. На переписывании слабого рекламного текста автор отметил, что Claude заменил расплывчатые формулировки на продающие. Там же названа обратная сторона: новая модель Opus, по наблюдению автора, выбирает один и тот же тип оформления, если в запросе не описать желаемый вид отдельно.
Работа по документу. На задании «найди третью главу в файле PDF и перескажи» в русскоязычном разборе ChatGPT описал материал, к третьей главе не относящийся, а Алиса пересказала вторую главу. Оба текста при этом выглядели уверенно. Это и есть довод в пользу сверки с исходником, о которой сказано выше.
Наблюдения такого рода дополняют зачёты, а не заменяют их: они сняты на одной задаче и одном авторе, тогда как арена собирает миллионы голосов, а индекс — тысячи прогонов. Полезны они тем, чего в числах не видно: формат, выполнимость и то, как модель понимает задание с двойным смыслом.
Сколько стоит написать текст нейросетью
Текстовые модели считают работу токенами: отдельно за то, что вы отправили, отдельно за то, что модель написала в ответ. Ставка GEN202 на текст ниже официальной цены разработчика ровно на десять процентов, оплата рублями, ключ один на весь каталог.
| Модель | Официально, $ за млн вход / выход | GEN202, вход | GEN202, выход | Контекст, токенов | Предел ответа |
|---|---|---|---|---|---|
| GPT-5.6 Luna | 0,2 / 1,2 | 18 ₽ | 108 ₽ | 1 050 000 | 128 000 |
| GPT-5.6 Terra | 2 / 12 | 180 ₽ | 1080 ₽ | 1 050 000 | 128 000 |
| GPT-5.6 Sol | 5 / 30 | 450 ₽ | 2700 ₽ | 1 050 000 | 128 000 |
| Gemini 3.6 Flash | 1,5 / 7,5 | 135 ₽ | 675 ₽ | 1 000 000 | 64 000 |
| Grok 4.5 | 2 / 6 | 180 ₽ | 540 ₽ | 500 000 | не назван |
| Claude Opus 5 | 5 / 25 | 450 ₽ | 2250 ₽ | 1 000 000 | 128 000 |
| Claude Sonnet 5 | 2 / 10 | 180 ₽ | 900 ₽ | 1 000 000 | 128 000 |
| Claude Fable 5 | 10 / 50 | 900 ₽ | 4500 ₽ | 1 000 000 | 128 000 |
Цены в рублях подставляются из каталога и меняются вместе с ним. Самый дешёвый вход в каталоге стоит 18 ₽ за миллион токенов. После входа на счёт зачисляется 50 кредитов (25 ₽), дальше счёт пополняется рублями, наименьший платёж — 500 ₽.
Полный список моделей со ставками — в каталоге, сравнение с официальными ценами — на странице цен, примеры вызова текстовых моделей — на странице API языковых моделей. Собрать текст без единой строки кода можно на странице нейросеть для текста.
Что брать под задачу: сводная таблица
Четырёхзначные числа в таблице — это рейтинг Elo из слепых голосов; баллы сводного индекса и проценты приходят из других зачётов. Между собой эти шкалы не сравниваются, каждая строка читается отдельно.
| Работа | Что показывают зачёты | Источник и дата снимка |
|---|---|---|
| Любой текст, оценка читателем | Claude Fable 5 — 1507, Claude Opus 4.6 (high) — 1505, Claude Opus 4.7 (high) — 1502 | Arena, Text Arena, 27 августа 2026 |
| Рассуждение и доведение задачи до конца | Claude Opus 5 (max) — 63,1, Claude Fable 5 — 62,1, GPT-5.6 Sol (max) — 60,9 | Artificial Analysis, Intelligence Index v4.1.1, 30 августа 2026 |
| Текст на русском | Claude Fable 5 — 1519, Gemini 3.7 Flash (high) — 1517, Muse Spark 1.2 (xHigh) — 1512 | Arena, разрез Russian, 27 августа 2026 |
| Длинный текст на русском, разбор документа | Qwen3.5-27B — 96,36, DeepSeek-v4-Pro — 94,94, Claude Opus 4.8 — 93,97 | MERA Reason, колонка MMReD, 30 июля 2026 |
| Короткий текст десятками вариантов | Gemini 3.7 Flash — 330 ток/с, GPT-5.6 Luna — 127, GPT-5.6 Terra — 114 | Artificial Analysis, 30 августа 2026 |
| Переписка и письма | GLM-5.3-Flash — 1,5 с до первого токена, GLM-5.3 (max) и DeepSeek V4 Pro — 1,6 | Artificial Analysis, 30 августа 2026 |
| Переписывание готового текста | Самый дешёвый вход: GPT-5.6 Luna — 18 ₽ за миллион входных токенов | Каталог GEN202 |
| Большой объём исходников в одном запросе | GPT-5.6 — 1 050 000 токенов, Claude и Gemini 3.6 Flash — 1 000 000, Grok 4.5 — 500 000 | Каталог GEN202 |
| Российские модели рядом с зарубежными | Alice AI LLM — 1083, T-pro-it-2.0 — 1036, GigaChat 2 Max — 999 | llmarena.ru, 18 апреля 2026 — история вопроса |
Строки таблицы независимы друг от друга: под три разные работы у одного человека спокойно выходят три разные модели. Разбор всех задач сразу — тексты, картинки, код, русский язык — собран в статье про лучшую нейросеть под задачу; отдельно по коду — лучшая нейросеть для написания кода.
FAQ
Какая нейросеть лучше всего пишет тексты? По слепым голосам живых людей первое место занимает Claude Fable 5 — 1507 очков при интервале ±5 и 25 824 сравнениях (Arena, Text Arena, снимок 27 августа 2026 года). Рядом с ней в пределах интервала стоят Claude Opus 4.6 в режиме high с 1505 и Claude Opus 4.7 в режиме high с 1502, поэтому первую строку правильнее читать как верхнюю группу из трёх моделей, а не как единственного победителя.
Какая нейросеть лучше для текста, если считать по деньгам? Ставки за миллион выходных токенов различаются в каталоге больше чем в сорок раз: официально 1,2 доллара у GPT-5.6 Luna против 50 у Claude Fable 5. При этом разница в сводном индексе Artificial Analysis между ними — 52,3 против 62,1 балла на снимке 30 августа 2026 года. Порядок отсюда такой: короткие и типовые тексты уходят на нижние ступени, длинный материал и работа с рассуждением — на верхние.
Какая лучшая нейросеть для написания статей? Статья упирается в предел ответа и в цену выхода. Предел ответа в каталоге GEN202 — до 128 000 токенов у моделей Claude и у трёх уровней GPT-5.6, до 64 000 у Gemini 3.6 Flash. По зачётам верх на длинной работе занимает семейство Anthropic: Claude Opus 5 в режиме max с 63,1 балла индекса и Claude Fable 5 с первым местом в слепом голосовании.
Какая нейросеть лучше пишет по-русски? В русском разрезе Arena на 27 августа 2026 года первой стоит Claude Fable 5 с 1519 ±12, второй — Gemini 3.7 Flash в режиме high с 1517 ±24, третьей — Muse Spark 1.2 с 1512 ±32. Интервалы широкие, потому что голосов по русскому 804 885 против почти восьми миллионов в общем зачёте, поэтому из этой таблицы берут состав верхней группы, а не порядок мест. Сводный индекс Artificial Analysis к русскому языку отношения не имеет: источник прямо пишет, что индекс собран на англоязычных заданиях.
Есть ли хорошая бесплатная нейросеть для текстов? В верхней двадцатке слепого голосования стоят две модели с открытой лицензией, и лицензия напечатана в самой таблице Arena: GLM-5.3 Max от Z.ai под MIT — 1484 очка и пятнадцатое место, Kimi K3 Max от Moonshot под собственной лицензией Kimi K3 — 1489 и десятое место. Попробовать платные модели можно в чате на этой странице: первый ответ идёт за счёт сервиса, без регистрации.
Какая нейросеть пишет без воды? Объём ответа задаётся в самом задании, а не выбором модели: предельная длина в знаках, запрет на вступления и обобщения, один пример на мысль. Ограничить длину ответа можно и параметром запроса — как устроен этот предел и из чего складывается счёт, разобрано в статье про миллион токенов.
Можно ли доверять фактам в тексте от нейросети? Сверка с исходником обязательна. В разборе с одинаковыми заданиями на канале «Нейросети для экспертов с Анастасией Тарасовой» модель, которую попросили пересказать третью главу файла PDF, описала материал не из неё, а другой сервис пересказал вторую главу — и оба текста выглядели уверенно. Числа, цитаты и ссылки проверяются по источнику до публикации.
Почему в разных топах нейросетей для текста разные победители? Потому что зачёты меряют разное. Arena считает голоса читателей на любых запросах, Artificial Analysis складывает девять проверяемых заданий по агентной работе, коду, научному рассуждению и знаниям, MERA Reason проверяет рассуждение на русском. Ни одно из девяти заданий сводного индекса не проверяет письмо, и сам источник называет индекс англоязычным. Плюс дата: снимок MERA из архива за 11 апреля 2026 года и llmarena.ru за 18 апреля 2026 года описывают прошлое поколение.
Как сравнить несколько моделей на своём тексте? Возьмите текст, который вы пишете каждую неделю, и отправьте одно и то же задание в две-три модели. GEN202 даёт один ключ ко всему каталогу и общий баланс в рублях, поэтому для сравнения не нужно трёх подписок. В чате ключ не нужен вовсе: модель выбирается в списке над полем ввода, и ответы разных моделей на один и тот же абзац видно рядом.
Чат с нейросетью онлайн
Claude, ChatGPT, Gemini, Grok и другие нейросети — в одном окне, прямо в браузере. Выберите нужную в списке над полем ввода и дайте задание со своим текстом: первый ответ бесплатно и без регистрации. Больше моделей и история разговоров — в чате с нейросетью.