GPT-6 Astra vs Claude Fable 5.1: почему мы берём обе

Две топовые модели вышли с разницей в два дня. Сравниваем GPT-6 Astra и Claude Fable 5.1 по контексту, ценам и бенчмаркам и показываем наш процесс с двумя агентами на ERP, миграциях и заказных B2B системах.
— Примерное время чтения: 29 минут
cover

В этом раунде никто не выиграл, поэтому мы берём обе модели

Две передовые модели вышли с разницей в несколько дней, и независимые тесты называют результат ничьёй. В сравнении GPT-6 Astra против Claude Fable 5.1 сервис Artificial Analysis даёт обеим по 53 балла в Intelligence Index v4.3 и по 62 в Coding Agent Index. Поэтому на сложных B2B-задачах мы перестали выбирать одну. Мы используем обе. Одна модель пишет, вторая проверяет, а слияние подписывает конкретный человек.

На той неделе, когда вышли обе модели, наш рабочий чат превратился в спор. Каждый клиент спрашивал одно и то же. Какую покупать. Это неверный вопрос, и цифры объясняют почему.

Рейтинги, по которым принято выбирать нейросети для программирования 2026 года, показывают, как модель справляется со стандартным набором задач. Она не скажет вам, какой агент неправильно поймёт назначение поля в модуле ERP, спроектирует миграцию вокруг этой ошибки, напишет тесты, которые с ошибкой согласны, а потом проверит собственную работу по собственному же неверному допущению. Такой сбой не виден в баллах. Он виден в продакшене.

Вот что вы найдёте ниже. Цифры с источниками, все на 11 сентября 2026 года. Разделённый вердикт вместо победителя. Десять шагов, которые мы реально выполняем на клиентских проектах. И случаи, когда одной модели достаточно, а вторая - просто лишний счёт.

Всё в этом сравнении изменилось за восемь дней

Astra вышла 3 сентября 2026 года. Fable 5.1 появилась примерно тогда же. 10 сентября OpenAI временно остановила новые подписки и переходы на тариф Pro за $200, потому что спрос на Astra обогнал доступные мощности. Решение о покупке, принятое по сравнению трёхнедельной давности, уже устарело.

Оба релиза целятся в одно и то же. Не в чат. В длинные агентские задачи, то есть в работу, которая идёт часами без участия человека. Это и есть агентная разработка ПО: модель не подсказывает строчку, а ведёт задачу целиком.

Существенно изменились три вещи, и все три бьют по счёту:

  • Окно контекста близко к 1 млн токенов у обеих. Целый устаревший модуль вместе с документацией и тестами теперь помещается в один запрос.
  • Уровень усилий на рассуждение стал реальным рычагом стоимости. У Astra пять уровней. Fable использует адаптивное мышление на высоком уровне по умолчанию. Настройка меняет то, сколько вы платите за задачу, а не только то, насколько умным звучит ответ.
  • Агентные среды работают без присмотра часами. А значит, неверное допущение на первом часу становится дорогим к четвёртому.

Сигнал о нехватке мощностей стоит учитывать в планах. Как сообщил Fortune 11 сентября 2026 года, пауза по тарифу Pro за $200 распространяется на переходы со всех нижних тарифов. Действующие подписки продолжают продлеваться. Если вы планировали в этом месяце подключить команду на этот тариф, проверьте доступность до того, как заложите бюджет.

Компании среднего сегмента в B2B чувствуют это первыми. Работа с ERP, интеграции и модернизация устаревших систем - именно те задачи с длинным контекстом и большой зоной поражения, ради которых эти модели и делались. Мы здесь не обозреваем запуск продукта. Мы описываем инженерный процесс, который из-за него изменили.

Модели, агенты для программирования и рабочие среды - это три разных слоя

Astra и Fable 5.1 - это модели. Codex и Claude Code - агенты для программирования, то есть обвязка, которая управляет моделью и набором инструментов. ChatGPT Work и Claude Cowork - среды для длинных задач, обе запущены 9 июля 2026 года. Оценка в бенчмарке принадлежит модели и обвязке вместе, и именно поэтому половина сравнений в сети противоречит друг другу.

Если совсем просто: Astra - это мозг, Codex - среда разработки, в которой он работает, Work - более широкая среда для длинных задач. На другой стороне то же самое: Fable 5.1, Claude Code и Cowork. Над всем этим стоит слой оркестрации: API провайдеров, инструменты для агентов, сервисы MCP, CI/CD и та внутренняя прослойка, которую вы строите сами.

Поэтому "Astra против Claude Code" - ошибка категории. Вы сравниваете мозг с мастерской. Корректная пара для сравнения сред - Codex против Claude Code, а корректная пара для сравнения моделей - Astra против Fable 5.1.

Это важно не только для словаря, но и для оценки. Поменяйте обвязку - и цифра сдвинется. Terminal-Bench v4.0 показывает 57,9% в собственной таблице OpenAI и 56% в прогоне Artificial Analysis на обвязке Codex. Название бенчмарка то же, окружение другое, результат другой. Когда вендор говорит "наша модель набирает X", уточняющих вопроса всегда три: в какой обвязке, при каком уровне усилий, на какую дату.

Codex принимает задачу, Claude Code ведёт диалог

Codex - это то, кому вы передаёте работу. Дайте ему репозиторий и задачу, он отработает в изолированной песочнице и отчитается по завершении. Claude Code - это то, с кем вы разговариваете. Он работает в вашем терминале, показывает ход рассуждений и останавливается в точках принятия решений.

Для нас эта разница не про вкусы. Выбор агента - это решение о том, сколько надзора требует задача. Чётко очерченное и механическое уходит к тому, кому делегируют. Неоднозначное и архитектурное - к тому, с кем спорят.

Спецификации, которые выглядят почти одинаково

У Astra окно контекста на 1 050 000 токенов, до 128 000 токенов на выходе, знания до апреля 2026 года и пять уровней усилий на рассуждение. У Fable 5.1 окно на 1 млн токенов, те же 128 тыс. на выходе, знания до июня 2026 года и адаптивное мышление, которое всегда включено на высоком уровне по умолчанию. На бумаге они близки. Различия начинаются в строке счёта.

ПараметрGPT-6 AstraClaude Fable 5.1
ID модели в APIgpt-6-astraclaude-fable-5-1
Окно контекста1 050 000 токенов1 000 000 токенов
Максимум на выходе128 000 токенов128 000 токенов
Знания доапрель 2026июнь 2026
Управление рассуждениемПять уровней усилий, от низкого до максимальногоАдаптивное мышление, всегда включено, по умолчанию высокое
Цена входа$10 за 1 млн токенов$10 за 1 млн токенов
Цена выхода$50 за 1 млн токенов$50 за 1 млн токенов
Кешированный вход$1,00 за 1 млн токенов$0,25 за 1 млн токенов
Наценка за длинный контекст2x свыше 272 тыс. входных токеновНет на всём окне в 1 млн
ДоступностьOpenAI APIClaude API, Bedrock, Google Cloud, Microsoft Foundry
Обязательство по сроку жизниНе опубликованоНе ранее 1 сентября 2027 года

Цифры подтверждены на странице моделей в документации OpenAI API и в документации платформы Claude по состоянию на 11 сентября 2026 года.

Каждый вендор прямо говорит о своей цели. OpenAI позиционирует Astra для "сложных рассуждений, программирования, работы с компьютером, исследований и создания документов". Anthropic позиционирует Fable 5.1 для "требовательных рассуждений и длинной агентской работы".

Две строки в этой таблице важнее, чем кажется. Регулятор усилий у Astra - настоящий инструмент контроля затрат: Artificial Analysis замерила все уровни, от низкого за $0,82 за задачу до максимального за $3,26, и все они лежат на границе эффективности "стоимость против интеллекта". А обязательство по сроку жизни Fable 5.1 - деталь, которую обычно не пишут в сравнениях. Закреплённый ID модели без даты и с опубликованной датой окончания поддержки означает, что под него можно планировать двухлетний проект по ERP.

Одинаковый ценник, два очень разных счёта

Обе модели заявляют $10 за миллион входных токенов и $50 за миллион выходных. Счета получаются разными. Astra пересчитывает весь запрос примерно в 2 раза дороже, как только промпт переваливает за 272 000 входных токенов. Fable 5.1 считает всё окно в 1 млн по стандартным ставкам и берёт $0,25 за миллион при попадании в кеш, то есть 2,5% от базовой цены входа.

Сначала о пороге у Astra, потому что он приходится ровно туда, где живут крупные B2B-кодовые базы. Выше 272 000 входных токенов ставки на вход и кеш удваиваются, а цена выхода растёт. Вторичные источники называют для этого длинноконтекстного уровня $20 за миллион входных и $75 за миллион выходных токенов и указывают, что повышенная ставка применяется ко всему запросу, а не только к токенам сверх порога. Цифры $20 и $75 считайте вторичными, а правило 272 тыс. и множитель 2x есть в собственной документации OpenAI.

У Fable 5.1 здесь два структурных преимущества, оба указаны в официальной документации Anthropic по ценам. Попадание в кеш стоит $0,25 за миллион, это на 75% дешевле, чем у Fable 5. И наценки за длинный контекст нет вообще: запрос на 900 тыс. токенов считается по той же ставке за токен, что и запрос на 9 тыс.

Вот как это выглядит в деньгах. Пример иллюстративный, это не коммерческое предложение. Один запрос: 500 000 некешированных входных токенов и 20 000 выходных. На Astra запрос оказывается выше порога, поэтому вы платите около $10,00 за вход и $1,50 за выход, примерно $11,50. На Fable 5.1 тот же запрос считается по стандартным ставкам: около $5,00 плюс $1,00, примерно $6,00.

Теперь честный противовес, потому что независимые данные по завершённой работе говорят об обратном. В стандартизированных прогонах Artificial Analysis Astra тратит около 27 тыс. выходных токенов на задачу Index против 78 тыс. у Fable и выходит на $3,26 за задачу против $7,63. Дешевле за запрос - не то же самое, что дешевле за результат.

Ещё одно примечание, которое ломает наивную арифметику. Claude 4.7 и более поздние версии используют новый токенизатор, который даёт примерно на 30% больше токенов на тот же текст. Сравнивать доллары за миллион токенов у двух вендоров - значит сравнивать разные единицы.

Поэтому мы работаем по правилу, а не по прайс-листу: мерьте стоимость выполненной задачи, а не цену за миллион токенов. Дешёвый токен, которому нужно три подхода, не дешевле. Кеширование в нашей схеме окупается в узком и предсказуемом сценарии: несколько агентов снова и снова читают одну и ту же документацию репозитория, спецификации и ADR в рамках одной работы.

Почему две таблицы бенчмарков дают два разных ответа

Независимые тесты фиксируют ничью. Artificial Analysis, публикация от 9 сентября 2026 года: Intelligence Index v4.3 - по 53 у обеих моделей, Coding Agent Index - по 62. Собственная таблица OpenAI показывает Astra впереди на большинстве бенчмарков по коду, а Fable 5.1 - заметно впереди на Humanity's Last Exam с инструментами: 65,0% против 57,2%. Обе таблицы настоящие. Они измеряют разное.

Сначала независимые цифры

Intelligence Index v4.3 - составной показатель из 10 оценок, среди них AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0, SciCode, Humanity's Last Exam, CritPt, AA-Omniscience и AA-LCR v1.1. Главный вывод прогона бенчмарков Artificial Analysis: Astra "делит лидерство с Claude Fable 5.1 в обоих наших флагманских индексах, при меньшей стоимости".

Метрика, максимальные усилияGPT-6 AstraClaude Fable 5.1
Intelligence Index v4.35353
Стоимость задачи Index$3,26$7,63
Выходных токенов на задачу Index27 тыс.78 тыс.
Coding Agent Index62, в Codex62, в Claude Code
Стоимость задачи по коду$7,09Примерно на 40% выше

Независимые замеры Artificial Analysis, 9 сентября 2026 года, все цифры при максимальном уровне усилий на рассуждение.

Две детали внутри этих цифр стоят больше, чем заголовок. На AA-Omniscience частота галлюцинаций у Astra падает с 92% у прошлого поколения до 51% при максимальных усилиях, и точность одновременно растёт на 4 пункта. А внутри Coding Agent Index победы не складываются, а расходятся: Astra выигрывает на Terminal-Bench v4.0 и SWE-Atlas-QnA и проигрывает на DeepSWE - 68% против 72%.

Собственная таблица OpenAI и строка, которая выдаёт всю картину

БенчмаркGPT-6 AstraClaude Fable 5.1
Terminal-Bench 4.057,9%55,8%
DeepSWE v1.174,1%67,4%
FrontierCode 1.1 Extended64,5%63,6%
AutomationBench41,4%31,4%
Внутренний бенчмарк по миграции БД63,9%57,8%
Humanity's Last Exam, с инструментами57,2%65,0%

Данные предоставлены вендором OpenAI, сентябрь 2026 года. Это не независимые измерения.

Последняя строка для нашего аргумента - самая полезная во всей таблице. По собственным цифрам OpenAI, Fable почти на восемь пунктов впереди в исследованиях и рассуждениях о незнакомых предметных областях. Превосходство в бенчмарке по коду не делает модель лучше в оспаривании архитектурного решения, а это совсем другая работа.

Три оговорки, которые определяют, как всё это читать

  • Данные вендора и независимые цифры не складываются. Нельзя усреднить таблицу OpenAI с индексом Artificial Analysis и получить рейтинг. У них разные обвязки и разные системы подсчёта.
  • Обвязка не нейтральна. Terminal-Bench v4.0 даёт 57,9% в одной конфигурации и 56% в другой. Тот же бенчмарк, другое окружение.
  • Сравнение без указания уровня усилий бессмысленно. Все цифры Artificial Analysis здесь приведены при максимальных усилиях. Смените уровень - сдвинутся и балл, и стоимость.

Ещё одно про источники. Как минимум одно издание приводит Coding Agent Index как 67 у Astra и 70 у Fable 5.1. Это противоречит опубликованным самой Artificial Analysis 62 против 62. Когда источники расходятся, берите первичный и говорите, каким пользовались. Мы используем Artificial Analysis.

По очкам здесь никто не выигрывает. Так что перестаньте искать победителя.

Что лучше делает Astra

Если смотреть на GPT-6 Astra для кода, она выигрывает в экономике и исполнении. Тот же балл индекса примерно за 40% стоимости задачи, около трети выходных токенов, самое большое окно контекста в 1 050 000 токенов, пять уровней усилий для контроля затрат на каждую задачу и почти вдвое сниженная частота галлюцинаций.

Главное - экономия токенов. 27 тыс. выходных токенов на задачу Index против 78 тыс., $3,26 против $7,63. В стандартизированной обвязке она делает ту же работу дешевле. В тестах по коду и автоматизации, опубликованных вендором, она также лидирует на Terminal-Bench, DeepSWE, AutomationBench, BenchCAD и внутреннем бенчмарке OpenAI по миграции баз данных.

Регулятор усилий - не маркетинговый ползунок. Каждый уровень, от низкого до максимального, лежит на границе эффективности по стоимости. Значит, дешёвую механическую работу можно отправлять на низкий уровень, а максимальный держать для того, что этого требует. Это реальный контроль бюджета по типам задач.

Падение уровня галлюцинаций заслуживает больше внимания, чем получает. Для агента, который работает без присмотра четыре часа, более низкая частота уверенных выдумок - это свойство безопасности, а не статистика. Работа с компьютером и управление браузером важны по той же практической причине: админ-панели, тестовые среды и старое ПО без API.

  • Плюсы: стоимость завершённой задачи, экономия токенов, выносливость в исполнении, пять уровней усилий, работа с компьютером.
  • Минусы: порог перерасчёта на 272 тыс. приходится ровно на зону монорепозиториев и устаревших кодовых баз, лидерство в бенчмарках не всеобщее, поскольку Humanity's Last Exam с инструментами уходит в другую сторону, новый доступ к Pro 20x приостановлен по состоянию на 11 сентября 2026 года, а один долго работающий агент может донести убедительную ошибочную гипотезу до самого конца.

Что лучше делает Fable 5.1

Claude Fable 5.1 для кода идёт вровень с Astra по измеренному интеллекту и по Coding Agent Index, а дальше выигрывает в том, что всплывает на третий месяц проекта. Чтение из кеша за $0,25 за миллион, отсутствие наценки за длинный контекст, всегда включённое адаптивное мышление и явное преимущество в исследованиях незнакомых областей.

Начнём с ничьей, потому что она превращает всё остальное в "и вдобавок". 53 против 53. 62 против 62. Ничто из перечисленного ниже не компенсирует более низкий балл.

Экономика кеша важнее всего именно в нашем процессе. Несколько агентов многократно читают один и тот же репозиторий, те же спецификации, тот же архитектурный контекст. При ставке в 0,025 от базового входа второе, третье и десятое чтение стоят почти ничего. Добавьте единую цену на всём окне в 1 млн токенов, и работа с длинным контекстом перестаёт быть темой для разговора о бюджете.

Дальше результат на Humanity's Last Exam: 65,0% против 57,2% в собственной таблице OpenAI. Этот бенчмарк измеряет исследование и рассуждение в областях, которых модель не видела. А это довольно точное описание того, чем на деле является критика ADR: прочитать незнакомую систему и найти в ней неверное допущение.

Адаптивное мышление на высоком уровне по умолчанию означает меньше настройки и меньше ошибок из-за выбора неподходящего уровня усилий. А агентные приёмы в Claude Code зрелые: субагенты, параллельное исследование, рабочие деревья, команды агентов, независимые агенты-ревьюеры.

  • Плюсы: экономика кеша, единая цена на длинный контекст, исследования незнакомых областей, агентные приёмы и опубликованная дата окончания поддержки, под которую можно планировать дорожную карту.
  • Минусы: более высокая измеренная стоимость стандартизированной задачи - $7,63 против $3,26, примерно втрое больше выходных токенов при максимальных усилиях, новый токенизатор, который даёт около 30% лишних токенов на тот же текст, и параллельные субагенты, которые быстро умножают расход, если за ними никто не следит.

Сколько стоят тарифы сейчас и в чём ловушка "20x"

По состоянию на 11 сентября 2026 года: Claude Pro стоит около $20 в месяц, Max 5x - $100, Max 20x - $200. ChatGPT Plus стоит $20, Pro 5x - $100, Pro 20x - $200, но новые подписки и переходы на Pro за $200 временно приостановлены 10 сентября 2026 года. Две пометки "20x" означают разный объём использования.

Тарифы для одного разработчика

На стороне Anthropic Pro стоит около $20 в месяц или порядка $17 в месяц при годовой оплате. Max 5x - $100, Max 20x - $200, только помесячно и только на сайте. Сессии сбрасываются раз в пять часов, а у тарифов Max есть ещё и недельный лимит, общий для всех моделей. Оба уровня Max включают Claude Code и Cowork.

На стороне OpenAI Plus стоит $20, Pro 5x - $100, Pro 20x - $200. Пауза от 10 сентября блокирует новые подписки и переходы на Pro за $200 со всех нижних тарифов. Действующие подписки это не затрагивает, они продолжают продлеваться. Но если такая подписка закончится, купить её заново до снятия паузы не получится.

Ловушка "20x". У OpenAI 20x отсчитывается от ChatGPT Plus. У Anthropic 20x считается на сессию и отсчитывается от Claude Pro. Две разные базы, и ни одна из них не является пакетом токенов. Сравнение тарифов по названию не говорит вам ничего.

OpenAI также публикует оценки числа сообщений за пять часов для Codex на Astra: от 5 до 45 локальных сообщений на Plus и Business Standard, от 25 до 225 на Pro за $100 и от 100 до 900 на Pro за $200. Читайте это как диапазоны, а не как жёсткие лимиты. ChatGPT Work и Codex делят общую квоту, а фактический расход меняется вместе с размером задачи, уровнем усилий и объёмом контекста.

Тарифы для команд и компаний

ТарифБазовыйПремиумEnterprise
OpenAI ChatGPT BusinessОколо $20 за пользователя в месяц при годовой оплате, $25 помесячно, минимум два местаОколо $100 за пользователя в месяц при годовой оплате, $125 помесячно, снимает пятичасовое ограничениеТолько по запросу. Отчёты о закупках 2026 года сходятся на $45 - $75 за место
Anthropic Claude Team$25 за место помесячно или $20 при годовой оплате, минимум пять мест$125 за место помесячно или $100 при годовой оплатеИндивидуальные условия

Цифры Anthropic опубликованы официально. Реальные цены OpenAI Business и Enterprise известны по отраслевым отчётам, а не из публикаций, поэтому считайте их ориентиром для бюджета и подтверждайте в коммерческом предложении.

Одно различие в биллинге регулярно ловит финансовые отделы. В Claude Team расход включён в подписку. В модели Claude Enterprise с оплатой по факту плата за место покрывает доступ к платформе, а расход выставляется отдельно по ставкам API. Это два разных по форме ежемесячных счёта.

Наш совет как команды, которая покупает и то, и другое: сначала пилотируйте на оплате по API, потому что только так видно реальную стоимость выполненной задачи. Переходите на места, когда узнаете, сколько ваша команда действительно потребляет.

Наши десять шагов: исследование, ADR, разработка, перекрёстная проверка

Человек ставит бизнес-задачу. Два агента исследуют её независимо. Человек сводит находки. Один агент пишет ADR, другой на него нападает. Ведущий инженер утверждает решение. Одна модель реализует, вторая проверяет, не видя рассуждений первой, тесты подтверждают результат, человек подписывает, и только после этого запускается CI/CD. Десять шагов, и три контрольные точки держат люди.

Это практика Webdelo в том виде, как её описывает наша команда. Без выдуманных бенчмарков и выдуманных процентов. Те же десять шагов мы применяем на клиентских проектах - от модулей ERP до разработки сайтов в Москве.

  • Шаг 1. Бизнес-задача. Человек задаёт цель, критерии приёмки, границы предметной области, затронутые интеграции, ограничения по данным, требования безопасности, ожидаемые тесты и план отката. Искусственный интеллект не определяет, что считать готовым.
  • Шаг 2. Независимое исследование. Обе модели отдельно изучают модуль, репозиторий, существующие ADR, схему базы данных, API, тесты и зависимости. Агент B никогда не пересказывает агента A. Нам нужны две гипотезы.
  • Шаг 3. Сведение результатов. Совпадения, противоречия, пробелы, риски, открытые вопросы. Расхождение - это сигнал, а не шум, и обычно оно указывает на ту часть, которую пока никто не понял.
  • Шаг 4. ADR и состязательная критика. Один пишет запись архитектурного решения. Второй атакует её по неверным допущениям, обратной совместимости, риску миграции, параллельному доступу, правам, согласованности данных, наблюдаемости, откату, производительности и сценариям отказа интеграций.
  • Шаг 5. Человеческий контроль архитектуры. Ведущий инженер принимает или меняет решение. На ERP и ключевых бизнес-системах этот шаг не обсуждается.
  • Шаг 6. Реализация. Одна модель становится основным исполнителем. Выбор зависит от репозитория, формы задачи, наблюдаемого качества, стоимости, доступной квоты и от того, задействован ли большой кешированный контекст. А не от того, кто набрал больше баллов на прошлой неделе.
  • Шаг 7. Перекрёстная проверка другим провайдером. Модель, написавшая код, никогда его не проверяет. Проверяющий получает требования, набор изменений, относящуюся к делу архитектуру и тесты. Он не получает рассказ исполнителя о ходе рассуждений. Это шаг против эффекта якоря.
  • Шаг 8. Объективная верификация. Модульные и интеграционные тесты, статический анализ, линтеры, проверка миграций, проверки безопасности и браузерные тесты там, где изменение затрагивает интерфейс.
  • Шаг 9. Проверка человеком. Находки искусственного интеллекта остаются предположениями, пока их не подтверждает код, тест, ограничение или воспроизведённая проблема.
  • Шаг 10. CI/CD. В обычную поставку попадают только проверенные и верифицированные изменения. Конвейер с ИИ дополняет инженерный контроль, но никогда его не заменяет.

Что делает этот процесс выносимым

Практичным, а не изматывающим, его делают две вещи. Изоляция рабочих деревьев, чтобы параллельные агенты не дрались за один каталог. И оркестратор, который раздаёт работу и собирает результаты, чтобы два инженера не копировали текст между двумя терминалами весь день.

Вот здесь мы расходимся с общепринятой практикой. Гонять весь цикл внутри оркестрации одного вендора удобно, и этим вы отдаёте вендору свой процесс. Права доступа, маршрутизацию, политики, секреты, журналы аудита и контроль затрат мы держим в своём слое. Стратегия с двумя провайдерами сама по себе служит аргументом: как только ваш процесс существует только внутри одной платформы, смена провайдера перестаёт быть решением и становится проектом.

Как это выглядит на модуле ERP

Представьте ошибку, ради которой этот процесс и существует. Агент читает модуль ERP и решает, что одно поле носит информационный характер. Это не так. Это поле управляет правилом проводки, которое кто-то написал в 2014 году и никто не задокументировал.

Агент проектирует миграцию вокруг своего допущения. Потом пишет код, который соответствует миграции. Потом пишет тесты, которые соответствуют коду. Потом проверяет собственную работу по собственной картине мира и не находит ничего неправильного, потому что изнутри всё правильно. Всё внутренне согласовано. И при этом неверно для бизнеса, а узнаете вы об этом при закрытии месяца.

У второго агента от другого провайдера есть реальный шанс это поймать. Другие обучающие данные, другие допущения по умолчанию, другая обвязка и никакого доступа к рассуждениям первого агента. Он читает поле, читает спецификацию и спрашивает, почему миграция считает его косметическим.

ERP - это та область, где подход окупается, из-за того, что в ERP находится. Финансовые данные, роли и права, журналы аудита, импорт и экспорт, интеграции со сторонними системами, бизнес-логика старше нынешней команды, зависимости от устаревших систем, процессы под конкретного клиента, миграции баз данных и требования к доступности. Сложность редко в том, чтобы написать функцию. Сложность в том, чтобы знать, что изменение этой функции заденет.

Здесь же окупается и параллельное агентское исследование. Обход репозитория, трассировка зависимостей, разбор документации, изучение тестов, планирование миграции и поиск рисков могут идти одновременно. Ведущие инженеры тратят часы на решения, а не на поиск. То же параллельное исследование окупается на клиентских платформах с большим объёмом данных - например, когда идёт разработка сайтов недвижимости, где объекты, правила цен и интеграции копятся быстро.

Маршрутизация на практике простая. Задачи с упором на терминал, чётко очерченные, пакетные по форме уходят к Astra в Codex. Неоднозначные, насыщенные контекстом, похожие на планирование - к Fable в Claude Code. Потом мы меняем их местами для проверки.

Здесь уместна честная оговорка. Обеим моделям около десяти дней. Публичных кейсов по ERP нет ни у одной из них, у нас тоже. Мы описываем процесс, а не кейс.

Наш следующий шаг по проверке, и это план, а не результат

Мы готовим внутреннее сравнение на 8 - 12 обезличенных реальных задачах из B2B и ERP в четырёх режимах: только Astra, только Fable, Astra реализует и Fable проверяет, Fable реализует и Astra проверяет.

Что будем измерять: долю принятых решений, прохождение тестов, реальное время выполнения, расход, количество правок от человека, обоснованные находки при проверке, ложные срабатывания, регрессии и число итераций до готовности к слиянию. Решающая цифра - принятые находки, которые нашёл только второй провайдер, потому что именно это по-настоящему проверяет тезис статьи.

Результатов пока нет. Мы не выдаём план за доказательство.

Почему модель плохо проверяет собственный код

Исследования 2026 года объясняют, почему самопроверка не работает: эффект якоря, предпочтение собственных ответов и галлюцинация правильности, когда модель во время проверки воспроизводит ту же ошибку рассуждения, что допустила при генерации. Дискуссия нескольких агентов это не чинит, если все агенты работают на одной модели.

Сценарии отказа конкретны, и за каждым стоит исследование:

  • Эффект якоря. Первая информация непропорционально влияет на все последующие суждения, включая оценку моделью собственной работы.
  • Предпочтение собственных ответов. Модели, обученные через RLHF, склонны соглашаться, а не оспаривать, и оценивают свой вывод выше, чем сопоставимый текст со стороны.
  • Галлюцинация правильности. Модели повторяют при проверке те же ошибки рассуждения, что и при генерации, вместо того чтобы сверить код со спецификацией. Работа "Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization" описывает ровно это.
  • Дискуссия усиливает предвзятость, когда у агентов одна модель. Исследование о закреплении предвзятости в дискуссии агентов на LLM показывает, что сильная внутренняя согласованность усиливает одни и те же слепые зоны, а не исправляет их.
  • У схемы "LLM как судья" есть слепые зоны. Исследования многошаговых агентов в продакшене показывают, что судья ловит лишь часть реальных сбоев.

Исследования поддерживают другой подход: проверку на другом распределении обучающих данных и разделение сессии разработки и сессии проверки, чтобы проверяющий не видел, как исполнитель пришёл к решению. Именно поэтому на седьмом шаге мы не передаём рассказ о рассуждениях. Убираем якорь - и проверяющему приходится выводить собственное мнение из спецификации и набора изменений.

Спецификация - тот шлюз, который вообще делает проверку возможной. Критерии приёмки, написанные человеком до реализации, - это то, с чем сверяется проверяющий. Без них у проверки нет опоры, кроме самого кода, а код всегда согласуется сам с собой.

Теперь ограничение, и мы настаиваем на том, чтобы его проговорить. Консенсус не является доказательством. Примерно в четверти случаев, когда мнения спорящих агентов расходятся, права оказывается позиция меньшинства, так что правило большинства может отбросить верный ответ. Перекрёстная проверка разными провайдерами повышает разнообразие взглядов. Она не гарантирует математически меньшее число дефектов. Человеческий контроль остаётся.

Есть и коммерческий побочный эффект, который финансовый отдел понимает сразу. Два провайдера означают, что изменение цен, сбой или смена политики у одного вендора не останавливают поставку. Ту же логику подстраховки мы используем в продвижении в AI, чтобы смена алгоритмов на одной платформе не забирала весь трафик клиента.

Что получает команда среднего сегмента и чем платит

Ценность берётся из устройства процесса, а не из доступа к более сильной модели. Мы не станем говорить вам, что искусственный интеллект делает разработку на 40% дешевле. Честно назвать такую цифру для вашей кодовой базы не может никто. Что мы можем назвать - это механизмы.

  • Более быстрое исследование. Параллельный разбор системы двумя агентами вместо последовательного чтения одним инженером.
  • Более короткий архитектурный цикл. Черновик ADR и критика на него приходят до разбора у ведущего инженера, так что он стартует с уже оспоренного предложения.
  • Больше покрытия проверкой. Второй независимый проход по коду, который раньше получал в лучшем случае один.
  • Дешевле механический анализ. Трассировка зависимостей и чтение документации перестают съедать часы ведущих инженеров.
  • Быстрее миграции и рефакторинг, при этом архитектура остаётся за инженерами.
  • Лучше непрерывность на длинных задачах, потому что контекст на 1 млн токенов вмещает весь модуль и его историю.

Затратная сторона реальна, и мы говорим об этом прямо. Две подписки. Два счёта за токены. Два набора инструментов. Два режима обработки данных, которые нужно проверить. И инженерное время на поддержание цикла. Разработка с двумя агентами - это статья расходов, а не бесплатное улучшение.

Деньги возвращаются в узком, но крупном месте. Меньше ошибочных архитектурных гипотез доходит до реализации. На миграции ERP одно неверное допущение, пойманное на второй неделе, стоит больше, чем год экономии на токенах.

Поэтому правило по бюджету намеренно скучное. Пилотируйте на одном модуле. Измеряйте стоимость выполненной задачи и долю переделок. Потом решайте. Раскатывать двух провайдеров на всю инженерную организацию в первый же день - верный способ получить счёт и не получить данных. Та же поэтапная логика работает, когда мы масштабируем интернет-маркетинг в Москве: сначала доказываем один канал, потом финансируем следующий.

Управление: два вендора означают удвоение всего

Каждый новый провайдер - это ещё одно соглашение об обработке данных, ещё одна запись о субподрядчике, ещё один режим, который надо согласовать. Прежде чем сравнивать цены за место, сравните, что каждый вендор делает с вашим кодом. OpenAI по умолчанию не обучается на контенте тарифов Business и Enterprise, а Anthropic Enterprise добавляет журналы аудита, SCIM, настраиваемые сроки хранения и ключи шифрования под управлением клиента.

Вопросы, которые решают дело, не про цену. Задавайте их в таком порядке:

  • Можно ли управлять доступом централизованно, через SSO и автоматическое заведение пользователей?
  • Что происходит с корпоративными данными и используются ли они для обучения?
  • Какие есть лимиты по одновременной работе и по неделе и кто заметит, что команда в них упёрлась?
  • Как нагрузка через API отделена от расхода по подписке?
  • Можно ли проверить действия ИИ постфактум?
  • До каких ваших систем агенты вообще могут дотянуться?

По средствам контроля на верхних тарифах оба вендора находятся примерно в одной точке. OpenAI Enterprise добавляет SOC 2, сквозное шифрование, размещение данных в нужном регионе, ключи под управлением клиента, SSO и SAML, SCIM, списки разрешённых IP, политики рабочего пространства, журналы аудита и ролевую модель доступа. Anthropic Team и Enterprise дают общие рабочие пространства, централизованную оплату и SSO, а Enterprise добавляет журналы аудита, SCIM, настраиваемые сроки хранения, API для комплаенса и аналитики, ключи под управлением клиента, вычисления только на территории США, коннекторы и конфигурации под HIPAA для подходящих организаций.

Цена подхода "берём оба", о которой никто не говорит, - это закупки. Удвоенная проверка вендоров, удвоенные соглашения об обработке данных, удвоенный анализ субподрядчиков. Для немецкой компании среднего сегмента с настоящим специалистом по защите данных это недели работы, а не галочка. Заложите это в бюджет до того, как примете решение.

Наши собственные незыблемые правила коротки. Каждое слияние утверждает конкретный инженер. У агентов нет прав на запись в основную ветку. Проверяющий агент получает спецификацию и набор изменений, но никогда не получает боевые доступы. Наша практика безопасности выстроена по принципам ISO 27001 и SOC 2, и мы движемся к формальной сертификации.

Когда достаточно одной модели

Одной модели хватает для небольших, чётко очерченных изменений с малой зоной поражения, без миграций и без затрагивания интеграций. Вторую мы подключаем там, где цена ошибочной архитектурной гипотезы выше цены ещё одного прохода проверки, а на практике это ERP, интеграции, миграции и модернизация устаревших систем. Посадочная страница под кампанию, где нужно сео продвижение сайтов в Москве, во второй проверке не нуждается.

Одной модели достаточно, когда задача чётко очерчена, зона поражения мала, опытный инженер всё равно прочитает изменения или модуль простой, а бюджет ограничен.

Astra с Codex в одиночку закрывает автоматизацию в терминале, CI/CD и скрипты для инфраструктуры, пакетные изменения во множестве однотипных модулей, а также автоматизацию браузера или интерфейса в ПО без API.

Fable 5.1 с Claude Code в одиночку закрывает неоднозначные задачи на планирование, рефакторинг по многим файлам в насыщенном контекстом коде, отладку того, чего в команде никто до конца не понимает, и финансовую или ERP-логику.

Мы берём обе, когда система критична для бизнеса, код касается денег или соответствия требованиям, кодовая база устаревшая и без документации, миграцию нужно доказать эквивалентной или ошибка дорого обходится при откате.

Мы не берём ни одну из этих схем, когда речь про прототип, одноразовый внутренний инструмент или команду из двух человек, которая не будет поддерживать оркестрацию. Стоимость работы двух агентов реальна, и на неподходящем проекте она не даёт вам ничего. Небольшой сайт с онлайн-записью, для которого нужна разработка сайта по ремонту техники, это ровно такой случай.

Поговорите с нами до выбора провайдера

Webdelo создаёт сложное B2B-ПО в Германии и США. Доработка ERP, интеграция систем, перенос платформ и заказные бизнес-системы, причём описанный выше процесс с двумя агентами уже работает у нас в продакшене.

Мы можем сделать для вас две вещи. Спроектировать безопасный процесс разработки с ИИ внутри вашей инженерной организации, с тем управлением и человеческими контрольными точками, которые ваш отдел комплаенса реально подпишет. Или вести проект по ERP, модернизации, миграции или заказной B2B-разработке с этим процессом с первого дня.

Первый разговор короткий и конкретный. Ваша зона поражения, ваши ограничения по управлению и то, какие части вашей работы оправдывают двух агентов, а какие нет. Напишите нам, чтобы обсудить проект.

Стройте инженерную систему, а не короткий список моделей

Интересный вопрос никогда не звучал как "какая модель победит". Независимые тесты говорят, что никакая. Вопрос в том, какую инженерную систему вы построите вокруг них и останется ли архитектура за человеком.

  • Честный итог - ничья. 53 против 53 в Intelligence Index, 62 против 62 в Coding Agent Index.
  • За одинаковыми ценниками скрываются две противоположные экономики. Astra дешевле в пересчёте на выполненную задачу, Fable дешевле при повторных чтениях большого контекста. Измеряйте стоимость выполненной задачи.
  • Сильные стороны действительно расходятся, и сила в коде не переносится на исследование незнакомых областей или критику архитектуры.
  • Перекрёстная проверка разными провайдерами опирается на исследования 2026 года, а не только на наше мнение. Она повышает разнообразие взглядов. Она не гарантирует меньшее число дефектов.
  • Для ERP, интеграций, миграций и модернизации дорогая ошибка - это неверная архитектурная гипотеза, а не медленная функция.

Все цифры в этой статье приведены на 11 сентября 2026 года. Обеим моделям около десяти дней, цены в этом месяце уже менялись, и это сравнение заслуживает перепроверки через три месяца. Если вы решаете сейчас, решайте сначала про процесс, а потом про провайдеров, и приходите обсудить с нами ту часть, которая будет верна и в следующем квартале.

Часто задаваемые вопросы

Какая модель лучше для кода, GPT-6 Astra или Claude Fable 5.1?

По независимым замерам это ничья. Artificial Analysis 9 сентября 2026 года опубликовала 53 балла у обеих моделей в своём индексе Intelligence Index v4.3 и 62 балла у обеих в Coding Agent Index. Таблицы самих вендоров показывают другую картину, потому что там другая обвязка и другой подсчёт, поэтому сложить их в один рейтинг нельзя. Полезнее спрашивать, какая модель под какую задачу, а не кто победил.

Цены API одинаковые, почему тогда счета разные?

У обеих на 11 сентября 2026 года заявлено 10 долларов за миллион входных токенов и 50 за миллион выходных. У Astra весь запрос пересчитывается примерно вдвое дороже, как только промпт переходит порог в 272 000 входных токенов, а Fable 5.1 считает всё окно на миллион токенов по обычной ставке и берёт 0,25 доллара за миллион при попадании в кэш. При этом на стандартных задачах Astra укладывалась в 3,26 доллара против 7,63 у Fable, так что дешевле за запрос не значит дешевле за результат. Считайте стоимость выполненной задачи, а не цену за миллион токенов.

Сколько стоят подписки и значит ли 20x одно и то же у обоих?

На 11 сентября 2026 года Claude Pro стоит около 20 долларов в месяц, Max 5x - 100, Max 20x - 200. С другой стороны ChatGPT Plus - 20 долларов, Pro 5x - 100, Pro 20x - 200, но 10 сентября 2026 года новые подключения и переходы на тариф за 200 долларов временно приостановили из-за нехватки мощностей. Две пометки 20x означают разный объём работы: одна считается от ChatGPT Plus, другая - от Claude Pro и в пределах сессии. Ни то ни другое не пакет токенов, поэтому сравнивать сами ярлыки бессмысленно.

Зачем брать две модели у разных поставщиков вместо одной?

Потому что модель плохо проверяет собственный код. Исследования 2026 года описывают эффект якоря, склонность к своим ответам и уверенные, но ложные выводы, когда при проверке модель повторяет ту же ошибку рассуждения, что допустила при написании, а спор нескольких агентов на одной модели только закрепляет слепое пятно. Поэтому одна модель пишет, а проверяет модель другого поставщика, не видя рассуждений автора. Это повышает разнообразие проверки, но не гарантирует меньше дефектов, поэтому решение всё равно подтверждает человек.

Когда хватает одной модели, а когда стоит платить за вторую?

Одной модели хватает, когда задача чётко очерчена, радиус последствий мал, нет миграций и внешних интеграций или опытный инженер всё равно прочитает изменения. Вторая окупается там, где ошибочная архитектурная гипотеза дороже ещё одного круга проверки: ERP, интеграции, миграции, модернизация старого кода. Прототипам, одноразовым внутренним инструментам и команде из двух человек она не даёт ничего. Два поставщика - это две подписки, два счёта за токены и два соглашения об обработке данных, то есть отдельная статья расходов, а не бесплатное улучшение.

Чем отличаются модель, кодовый агент и рабочая среда?

Astra и Fable 5.1 - это модели, та часть, которая рассуждает. Codex и Claude Code - кодовые агенты, то есть обвязка, которая управляет моделью и набором инструментов. ChatGPT Work и Claude Cowork - среды для долгих задач. Оценка в тесте принадлежит связке модели и обвязки, поэтому Terminal-Bench v4.0 показывает 57,9% в одном стенде и 56% в другом, и поэтому половина сравнений в сети противоречит друг другу.

Могут ли агенты сами вливать код в этом процессе?

Нет. Каждое вливание подтверждает конкретный инженер, у агентов нет прав на запись в основную ветку, а проверяющий агент получает требования и сами изменения, но никогда не получает доступы к рабочей среде. В процессе из десяти шагов за людьми три контрольные точки: постановка задачи и критерии готовности, принятие архитектурного решения и финальная проверка. Замечания агента остаются предложениями, пока их не подтвердит код, тест, ограничение или воспроизведённая проблема.

cookies Мы используем Cookie

Мы используем файлы Cookie для улучшения работы сайта, персонализации контента и анализа трафика. Вы можете выбрать, какие категории Cookie разрешить. Подробнее читайте в нашей Политике Cookie. Вы можете изменить свой выбор в любое время.

Необходимые (обязательные)

Обеспечивают работу сайта (навигация, доступ к защищённым разделам). Всегда включены и могут быть изменены только в настройках браузера.

Аналитические

Помогают нам понять, как вы используете сайт, чтобы улучшать сервис. Не собирают личные данные. Для аналитики мы используем ряд инструментов.

Маркетинговые / Рекламные

Используются для показа персонализированной рекламы и измерения эффективности рекламных кампаний.