Помните, как ещё пару лет назад мы удивлялись, что нейросеть может написать стихотворение или нарисовать кота? Сейчас это уже не кажется чем-то особенным. Вопросы, которые волнуют людей, звучат куда серьёзнее: какая модель способна заменить целый отдел разработки, кто лучше всех пишет код, и есть ли вообще смысл платить за подписку на одну модель, если завтра появится другая, ещё мощнее. Сентябрь 2026 года выдался на редкость урожайным на громкие релизы — Anthropic выпустила Claude Fable 5.1, OpenAI представила GPT-6 Astra с пафосным заявлением о начале «эры AGI», а Alibaba тихо, но уверенно подвинула конкурентов своей Qwen 3.8 Max. Разобраться в этом ворохе названий и цифр непросто, но мы попробуем — без маркетингового тумана и громких обещаний.
Лидеры сводных рейтингов: Fable 5.1 и Astra идут ноздря в ноздрю
Если открыть независимые платформы, которые следят за нейросетями, картина поначалу кажется почти шокирующей своей простотой. По данным BenchLM на 10 сентября 2026 года, лучшей моделью признана Claude Fable 5.1 с оценкой 84,6 балла из 100 . Следом идёт GPT-6 Astra с 84,1, а замыкает тройку Claude Opus 5 с 82 баллами. Разница между первым и вторым местом — всего полбалла. Это не пропасть, а статистическая погрешность. Иными словами, если вы спросите двух экспертов, кто лучше, один скажет Fable, другой — Astra, и оба будут правы. Fable 5.1 выигрывает за счёт более сбалансированного профиля: она одинаково хорошо справляется с кодом, научными задачами и агентными сценариями, тогда как Astra делает ставку на автономную работу и рекорды в отдельных дисциплинах.
Ситуация с рейтингом Artificial Analysis оказалась ещё интереснее. В версии v4.3, вышедшей 7 сентября, Claude Fable 5.1 и GPT-6 Astra делят первое место с одинаковым результатом — 53 балла . Следом расположились Claude Opus 5 (51) и Claude Fable 5 (50), а GPT-5.6 Sol довольствуется лишь 47 баллами. Получается, что два флагмана идут абсолютно синхронно, и любой разговор о «безоговорочном лидере» будет как минимум некорректным. Разница проявляется лишь в деталях: где-то Astra сильнее в агентных сценариях, где-то Fable 5.1 вырывается вперёд за счёт точности на сложных научных задачах. Но глобально — паритет, и это, пожалуй, главная новость сентября.
Отдельно стоит сказать о методологии рейтингов, потому что от неё зависит очень многое. Artificial Analysis в версии v4.3 увеличила вес закрытых тестовых наборов с 40% до 45%, чтобы лаборатории не могли «натаскивать» модели под конкретные бенчмарки . В индекс добавили AutomationBench-AA — бенчмарк на автоматизацию бизнес-процессов, а Terminal-Bench обновили до версии 4.0 с более сложными задачами. Всё это означает, что высокие позиции Fable 5.1 и GPT-6 Astra подтверждены на задачах, которые максимально приближены к реальной работе. Просто «зазубрить» ответы здесь уже не получится.
Claude Fable 5.1: ставка на код, знания и агентные задачи
Claude Fable 5.1 от Anthropic — это, пожалуй, самый обсуждаемый релиз сентября. Модель вышла 1 сентября 2026 года, и компания сразу назвала её «глобально самым продвинутым инструментом для программирования и интеллектуальной работы» . Anthropic выпустила сразу две версии: Fable 5.1 для широкой публики и Mythos 5.1 с ослабленными ограничениями безопасности, доступную только верифицированным организациям в сфере кибербезопасности и биологических наук . По сути, это одна и та же модель, но с разным уровнем защитных механизмов. Такой подход позволяет компании одновременно обслуживать и массовый рынок, и узкоспециализированных заказчиков, которым нужна максимальная свобода действий.
Что касается практических результатов, Fable 5.1 демонстрирует впечатляющий рост в задачах, связанных с кодом и научными исследованиями. В тесте Terminal-Bench-Science модель набрала 52,6%, что более чем вдвое превышает результат предыдущей Fable 5 (24,7%) . В SWE-bench Pro, который оценивает способность работать с реальными репозиториями, Fable 5.1 лидирует с показателем 81,2%. Эти цифры важны не сами по себе, а как индикатор того, что модель действительно умеет решать многошаговые задачи, а не просто генерировать правдоподобный текст. Для разработчиков и аналитиков это означает меньше времени на отладку и больше — на содержательную работу.
Ценовая политика Anthropic тоже заслуживает внимания. Стоимость Fable 5.1 осталась на уровне предыдущей версии: 10 долларов за миллион входных токенов и 50 долларов за миллион выходных . Однако за счёт оптимизации кэширования реальные затраты на типичные рабочие нагрузки снижаются примерно на 25%, а на агентные задачи — до 45% . Получается, что компания не стала повышать цену за возросшие возможности, а наоборот, сделала модель экономически более привлекательной. В условиях, когда конкуренты активно демпингуют, это выглядит как осознанная стратегия удержания корпоративных клиентов.
GPT-6 Astra: AGI-риторика и рекорды в агентных сценариях
OpenAI пошла другим путём. Вместо сдержанных формулировок о «новых возможностях» компания устами своего президента Грега Брокмана объявила о наступлении эры AGI. «Если мы перенесёмся на пару лет вперёд и оглянемся назад, спрашивая, когда же была создана AGI, я думаю, это будет примерно сейчас, и, возможно, это именно эта модель», — заявил Брокман на пресс-брифинге, описывая Astra как «поколенческий скачок в возможностях» . Это смелое заявление, которое, впрочем, подкреплено вполне конкретными техническими достижениями. Astra стала первой моделью OpenAI, обученной с использованием более 100 000 графических процессоров в дата-центре Stargate в Техасе . Контекстное окно достигает 1,05 миллиона токенов, а максимальный вывод ограничен 128 тысячами токенов .
В тесте DeepSWE v1.1, оценивающем способность самостоятельно решать реальные задачи по разработке ПО, Astra показала рекордные 74,1%, обойдя Claude Fable 5.1 на 6,7 процентных пункта. Модель также продемонстрировала 99,9% в ARC-AGI-3 и 100% в ExploitBench — тесте на поиск уязвимостей в программном обеспечении . Эти результаты объясняют, почему OpenAI так уверенно говорит о качественном скачке, а не просто об очередном обновлении. Astra умеет работать в браузере и настольных программах, заполнять веб-формы, обновлять записи в CRM, работать с календарём и создавать документы . По сути, это уже не просто чат-бот, а полноценный цифровой сотрудник, способный выполнять рутинные операции без вмешательства человека.
Однако у медали есть и обратная сторона. Стоимость GPT-6 Astra составляет 10 долларов за миллион входных токенов и 50 долларов за миллион выходных — это в 2,5 раза дороже предыдущей флагманской модели GPT-5.6 Sol . Для массового пользователя такая цена может стать барьером, но для корпоративного сегмента, где на кону автоматизация целых отделов, она выглядит оправданной. Показательно, что Astra занимает большую часть границы Парето по соотношению «интеллект — стоимость задачи», предлагая наименьшие затраты на задачу при своём уровне возможностей . Иными словами, даже при высокой цене за токен модель остаётся экономически эффективной за счёт того, что решает задачи с первого раза и не требует множества повторных попыток.
Китайский вызов: Qwen 3.8 Max и другие претенденты
Нельзя игнорировать и китайских разработчиков, которые в 2026 году заметно сократили отставание от американских лабораторий. Alibaba в августе выпустила Qwen 3.8 Max — модель на архитектуре Mixture-of-Experts с общим числом параметров 2,4 триллиона . Такая архитектура позволяет держать высокую скорость при умеренных вычислительных затратах. Модель поддерживает текст, изображения и видео, а контекстное окно составляет 1 миллион токенов . В ходе внутренних тестов Qwen 3.8 Max самостоятельно завершила программный проект за 16 дней без вмешательства человека . Это уже не лабораторная демонстрация, а реальный сценарий автономной работы, который может быть интересен крупным компаниям.
По ряду бенчмарков китайская модель действительно обходит американских конкурентов. В частности, Qwen 3.8 Max опередила GPT-5.6 Sol и Claude Fable 5 в семи тестах на программирование и общие логические способности, а также заняла лидирующие позиции в 36 испытаниях, связанных с машинным зрением . Цена при этом значительно ниже: 2 доллара за миллион входных токенов и 6 долларов за миллион выходных . Для сравнения, аналогичные показатели у Opus 5 в пять-восемь раз выше. Alibaba также планирует открыть веса модели на Hugging Face и ModelScope, что делает её доступной для самостоятельного развёртывания . Такой шаг может серьёзно изменить расстановку сил на рынке корпоративных решений, где стоимость играет далеко не последнюю роль.
Однако сводные рейтинги пока не ставят Qwen 3.8 Max на первое место. В Artificial Analysis Intelligence Index открытые модели во главе с GLM-5.3 Flash (42 балла) и Qwen 3.8 2.4T A95B (40 баллов) уступают лидерам около 11–13 пунктов . Это существенный разрыв, который говорит о том, что в самых сложных задачах — научных рассуждениях, многошаговом планировании, работе с неоднозначными данными — американские модели пока сохраняют преимущество. Но разрыв сокращается быстрее, чем кто-либо ожидал ещё год назад. И если текущие темпы сохранятся, к концу года картина может снова измениться. Так что следить за этим противостоянием будет по-настоящему интересно.


