Витрина вместо кассы: почему передовые ИИ-модели уже не впечатляют

Витрина вместо кассы: почему передовые ИИ-модели уже не впечатляют

14 сентября 2026, 19:40 1 просмотров ForkLog

1 сентября Anthropic выпустила Claude Fable 5.1 и Mythos 5.1. На следующий день Google представила Gemini 3.8 Flash, а Meta — Muse Spark 1.3. 3 сентября OpenAI открыла ограниченный доступ к GPT-6 Astra, и президент компании Грег Брокман закончил брифинг для прессы словами: «Добро пожаловать в эру AGI». Четыре релиза от крупнейших лабораторий всего за трое суток, но без вау-эффекта и былого ажиотажа. Похоже, рынок начал уставать от рекордов в бенчмарках и очередных громких заявлений о технологической сингулярности и неизбежном «восстании машин». Прагматичные управленцы стали все чаще смотреть сначала на цену и лишь потом на результаты тестов. Тревожатся теперь сами разработчики. Через полторы недели после каскада релизов глава Anthropic Дарио Амодеи призвал отрасль притормозить: сами нейросети начали создавать следующие поколения ИИ-решений, и контроль за этим процессом «хромает». Разберемся, что круче и мощнее — Astra или Fable 5.1, насколько близок AGI и почему бизнес больше не гонится за передовыми моделями. Битва титанов Такой плотности релизов новых ИИ-моделей в отрасли еще не случалось. Лидером объявила себя каждая из ведущих компаний, однако у всех решений свои недостатки и преимущества. Высокую планку задала OpenAI. Вице-президент по исследованиям Эйдан Кларк рассказал журналистам, что обучение Astra стало самым масштабным в истории компании. На техасской площадке Stargate задействовали более 100 000 графических процессоров. За ходом работы присматривали более старые версии LLM: такого раньше не практиковалось. На брифинге Брокман предложил журналистам решить самим, наступила ли эра AGI, и добавил, что лично он считает этот порог пройденным. Однако двумя днями ранее гендиректор OpenAI Сэм Альтман называл сам термин расплывчатым и маркетинговым. Anthropic действовала сдержаннее. Fable 5.1 и Mythos 5.1 — по сути, одна и та же разработка с разным набором ограничений. Первая модель технически доступна всем, но по подписке не входит в лимит — лишь через отдельные пользовательские кредиты.  Второе решение компания предлагает только избранным организациям из «белого списка». У модели слабее защитные фильтры, которые в обычной версии блокируют запросы по биологии и кибербезопасности. В презентации Fable 5.1 ключевым пунктом шли не рекорды в тестах, а гарантия для корпоративных клиентов: данные могут обрабатываться в облаке самого заказчика, не попадая на серверы разработчика. Google флагманскую модель так и не выпустила, зато выдала «рабочую лошадку» Gemini 3.8 Flash — третий релиз линейки всего за шесть недель. Одновременно компания представила 3.8 Flash Cyber — узкоспециализированную систему, ориентированную на ограниченный круг специалистов по защите цифровой инфраструктуры. Команда безопасности Chrome отчиталась, что LLM находит верное исправление уязвимости в 2,6 раза чаще, чем известные коммерческие аналоги. Флагманскую Gemini 3.5 Pro пользователи ждут с весны. В мае 2026 года глава Alphabet Сундар Пичаи пообещал, что передовая разработка появится «в следующем месяце». Ни в июне, ни в середине июля, ни в августе этого не произошло. К сентябрю у нее нет ни идентификатора в API, ни тарифа, ни даты выхода: каталог Google DeepMind по-прежнему помечает ее как готовящуюся к релизу. Meta пошла своим путем. Через неделю после Muse Spark 1.3 компания запустила одноименного агента: он делает покупки, разбирает почту, ведет календарь и бронирует билеты.  Таким образом, Anthropic и OpenAI спорят о том, чья модель умнее, а Google и Meta — чья быстрее закроет конкретную задачу. Что почем Astra обойдется в $10 за миллион входных токенов и $50 за такой же объем выходных — в 2,5 раза дороже предыдущего флагмана от OpenAI. У Fable 5.1 цена ровно та же, но Anthropic вчетверо снизила плату за чтение кеша, до $0,25: на типовых нагрузках это дает около 25% экономии, на агентных — до 45%. Совпадение тарифов не означает равных счетов в конце месяца — оплата идет за объем обработанного текста, а не за сам доступ. Одна система рассуждает подробнее и тратит на это больше ресурсов, другая приходит к тому же результату за меньшее число шагов. Тут мяч явно на стороне OpenAI. У Google и Meta ценообразование совершенно иное. Gemini 3.8 Flash — $0,75 и $3,75 в рамках акции, действующей до 31 декабря 2026 года; с 1 января тарифы удвоятся. Muse Spark 1.3 — $1,25 и $4,25. Агент доступен по подписке: $20 в месяц за тариф Power и $100 за Maximum. Разрыв между верхним и нижним ценовым предложением — тринадцатикратный. При таком разбросе каждый новый ИИ-флагман воспринимается примерно как концепт-кар: посмотреть приходят все, но для себя выбирают транспорт попроще. Пять релизов ведущих ИИ-компаний за девять дней сентября и цены на них: от $0,75 до $50 за миллион токенов. Источник: OpenAI, Anthropic, Google, Meta. Победа здравого смысла? Несколько лет бизнес фокусировался в основном на самом мощном из доступного. Теперь, по всей видимости, эта привычка уходит в прошлое. Fable 5 вышла 9 июня, но пробыла в открытом доступе лишь трое суток. 12 июня Anthropic получила директиву Минторга США об экспортном контроле со ссылкой на аспекты национальной безопасности: пользоваться моделью запрещалось любым иностранным гражданам, включая сотрудников компании. Эффективно отделить их от остальных клиентов на уровне API не было возможности, и разработку Fable 5 и Mythos 5 отключили для всех. Доступ к флагманской LLM вернули 1 июля, после почти трех недель простоя — ограничения отозвал министр торговли Говард Латник.  К концу августа на самую мощную модель приходилось около 11% всех корпоративных расходов на продукты Anthropic. Доля Fable 5 в общем объеме токенов оказалась заметно ниже — лишь 6%, купленных компаниями у разработчика Claude. В денежном выражении показатель выше вдвое — флагман заметно дороже остальной линейки, поэтому те же запросы обходятся в копеечку. Такой разрыв показывает, что от топовой модели корпорации полностью не отказались. Но теперь к ней обращаются реже и по особым поводам, отдавая рутину более простым решениям вроде Opus и Sonnet. У OpenAI пропорция сглаженнее: на GPT-5.6 Sol приходится 25% токенов и 23% всех трат на модели компании. Внутри линейки Anthropic произошла рокировка: вышедшая в конце июля Opus 5 за считанные недели обошла Fable 5 по корпоративным тратам. Мощная модель вдвое дешевле по тарифу на токены, а по сводному индексу Artificial Analysis даже опережает экс-флагмана — 51 балл против 50. «Большинству не нужно работать на самом верху технологической планки», — сказал в разговоре с FT Майлс Клементс из фонда Accel, вложившего в Anthropic около $1 млрд. Есть и другая, менее очевидная причина слабого спроса. Главный экономист Ramp Ара Харазян отметил, что компаниям мешали встраивать Fable в свои процессы правила хранения данных, введенные администрацией Дональда Трампа. Через два месяца создатель Claude выпустил обновленную версию модели и первым делом пообещал корпоративным клиентам обработку информации в их собственном облаке. Представители Ramp подчеркнули, что их выборка смещена в сторону технологических фирм. Это значит, что с высокой долей вероятности в остальных отраслях флагман используют еще реже. Реванш OpenAI Пять кварталов подряд корпоративные клиенты наращивали расходы на продукты Anthropic быстрее, чем на разработки главного конкурента. Однако с 1 июля впервые за долгое время в лидеры сегмента вырвалась OpenAI. Квартальный прирост расходов компаний на модели OpenAI и Anthropic: впервые за шесть кварталов компания Сэма Альтмана обошла главного конкурента. Источник: Financial Times, данные Ramp AI Index Выручка компании Сэма Альтмана увеличилась на 35% за три месяца и в пересчете на год превысила $40 млрд. Драйвером роста стал июльский запуск модели GPT-5.6, которая обходится в 2,5 раза дешевле Fable 5 при сопоставимых результатах в тестах. Харазян оценил ситуацию так: прежние темпы роста сулили Anthropic господство на рынке, но сильный релиз конкурента и неудачный старт Fable 5 кардинально изменили картину. Astra vs Fable 5.1 Обе компании выпустили сравнительные таблицы. В каждой из них первое место «объективно» заняла своя же модель. Astra уверенно лидирует в точных науках. На FrontierMath Tier 4 она решает 97,6% задач против 87,8% у Fable 5.1, в тесте GPQA Diamond — 96% и 93,7% соответственно. Флагман от OpenAI удерживает первенство и в самостоятельной работе с командной строкой: модели ставят научную вычислительную задачу и оставляют один на один с терминалом — 64,6% против 52,6%. Междисциплинарные задачи — вотчина Anthropic. На Humanity's Last Exam, где разрешено обращаться к поиску и запускать код, Fable 5.1 набирает 65% против 57,2%. На агентной офисной работе она, по собственным замерам компании, удерживает 1853 балла рейтинга Эло против 1711 у GPT-5.6 Sol. К этим цифрам стоит относиться с долей скептицизма. В сносках OpenAI указано, что часть тестов для Claude проводили с измененными условиями, а из «биологических» наборов модели Anthropic исключили вовсе — они отклоняют большинство вопросов. Независимую оценку дает Artificial Analysis. Компания прогоняет популярные системы через один и тот же набор из десяти испытаний и сводит результаты в единый показатель, заодно подсчитывая, во сколько обошелся каждый заход. Здесь первое место делят обе разработки, по 53 балла. Расходы на вычисления при этом разные — $7,63 против $3,26 в расчете на решенную задачу. Обе компании дают клиенту выбор: модель может рассуждать дольше или выдавать ответ быстрее. Если перевести обе в экономный режим, баллы останутся прежними, а вот разница в счетах увеличится — $5,98 против $2,31. Результат один, а разрыв между самой дорогой и самой дешевой конфигурацией — более чем трехкратный. Сводный рейтинг популярных ИИ-моделей. Источник: Artificial Analysis. Ниже по таблице разброс шире. Muse Spark 1.3 от Meta набирает 48 баллов при $1,6 за задачу. Открытая GLM-5.3-Flash китайской Z.ai — 42 балла при 25 центах. Между ней и максимальной конфигурацией Fable 5.1 всего 11 баллов разницы, но в денежном выражении разрыв тридцатикратный. Именно эта пропорция и определяет выбор корпоративного заказчика. Верхние строчки рейтинга занимают модели, цена которых требует для финдиректора отдельных объяснений. Стоимость решения одной задачи против сводного балла интеллекта: у разных моделей с одинаковым результатом цена расходится втрое. Источник: Artificial Analysis. Сам рейтинг не без оговорок. Например, Artificial Analysis раскрывает, что тестировала Fable 5.1 до релиза по заказу Anthropic. Цена лидерства Заявление Брокмана о начале «эпохи общего ИИ» не лишено оснований — оно опирается на рекордные значения ARC-AGI-3. Работает испытание так: программу «высаживают» в пошаговую головоломку, не сообщая ни правил, ни цели. Дальше она действует наугад, нащупывает закономерности и пытается справиться с заданием. Astra прошла 99,9% испытаний, однако организаторы из ARC Prize Foundation в собственном разборе сопроводили рекорд тремя примечаниями: Обвязка. Речь о программе-посреднике: она показывает модели картинку, принимает ответ и решает, какие из прошлых ходов напомнить. Через универсальный вариант, который применяют ко всем участникам, Astra справилась лишь с 62,7% уровней. Рекорд она поставила в фирменной версии от самой OpenAI, позволяющей ей переиспользовать собственные рассуждения. Разрыв в 37% обусловлен способом подачи данных, а не моделью как таковой. Цена. Один полный прогон обошелся в $26 098 в первом случае и $18 817 во втором. Для сравнения: добровольцам из контрольной группы платили $115 за полуторачасовую сессию. Определение — самое весомое из трех примечаний: ARC Prize считает системой общего интеллекта ту, что осваивает новый навык так же быстро, как человек. Под этот критерий Astra не подходит, и организация прямо оговорила, что общим интеллектом ее не считает. Кое в чем машина все же превзошла людей. На 96% уровней она добиралась до цели за меньшее число ходов, чем средний участник контрольной группы. Учится Astra не быстрее человека, зато решает задачи с первых же попыток. Когда ждать полноценный общий ИИ — вопрос открытый. Сводная оценка нескольких аналитических площадок указывает на 2031 год с разбросом от 2027 до 2044. Руководители ведущих лабораторий называют диапазон 2026–2030. Три прогноза по срокам появления общего искусственного интеллекта: от оценок глав ИИ-лабораторий до сводного показателя аналитических площадок. Источник: ARC Prize Foundation, Samotsvety. Премия за воздух Слабый спрос на топовую модель Anthropic совпал с подготовкой к «большому плаванию». Компания рассчитывает привлечь до $100 млрд при оценке около $2 трлн — это может оказаться крупнейшим первичным размещением акций (IPO) в истории фондового рынка. Якорным инвестором предположительно выступит Nvidia — компания рассматривает вложение до $10 млрд в Anthropic в ходе IPO. Представители обеих компаний на запрос Bloomberg не ответили, а сами планы, по данным агентства, еще могут измениться. Сколько стоит разработчик Claude, пока никто толком не знает: $965 млрд — по этой оценке закрыт майский раунд финансирования Серии H, в котором компания привлекла $65 млрд; около $1,38 трлн — столько бумаги стоят на вторичном рынке, где сотрудники и ранние инвесторы перепродают доли; до $2 трлн — ориентир для размещения. Для сравнения: в марте OpenAI привлекла $122 млрд при оценке в $852 млрд. На криптоплатформах формируются несколько иные цифры. Бессрочные контракты на акции Anthropic торгуются на 18 площадках со средней подразумеваемой оценкой около $1,96 трлн. Надбавка ко вторичному рынку — 42%. Первой среди криптобирж новые инструменты представила Binance. 2 июня, на следующий день после подачи Anthropic конфиденциальной заявки на IPO, стала доступна пара ANTHROPICUSDT с плечом до 20x. Аналогичные контракты есть на Bybit, Bitget и Hyperliquid.   Сама Anthropic от таких продуктов открестилась. 12 мая компания объявила несанкционированные передачи долей через SPV и цифровые аналоги бумаг ничтожными. Продавцов подобных инструментов фирма назвала мошенниками и распространителями продукта, который может в итоге ничего не стоить. После этого заявления токены рухнули на 27–40% за день, а инструменты от «прослоек» — на 40–50% за неделю. Однако к сентябрю котировки производных не только отыграли падение, но и поднялись выше прежних уровней. Недавний прецедент — SpaceX. Перед выходом компании на биржу бессрочный контракт закладывал $154 за бумагу и оценку в $2,01 трлн. SpaceX разместила акции по $135 при рыночной стоимости около $1,75 трлн, а за три следующие сессии показатель просел на $600 млрд — эквивалентно почти половине капитализации биткоина. Оценка Anthropic по трем источникам до размещения против динамики капитализации SpaceX после выхода на биржу. Источник: Anthropic, DefiLlama, Financial Times.  Банки тем временем готовят следующий шаг. Morgan Stanley и Goldman Sachs добиваются для Anthropic и OpenAI инвестиционного кредитного рейтинга сразу после размещений — это открыло бы доступ к рынку корпоративных облигаций объемом $11,7 трлн. S&P и другие агентства решений пока не приняли: обе компании убыточны, свободного денежного потока почти нет. К гонке подключились и куда более крупные игроки. Так, Nvidia гарантировала до $105 млрд кредитной поддержки по дата-центру OpenAI в Огайо, получив взамен статус эксклюзивного поставщика вычислений — «удовлетворительный рейтинг» стал одним из условий сделки.  Похожая история и у Oracle: 9 июля агентство S&P срезало ее кредитный рейтинг до уровня на ступень выше «мусорного», связав решение с тем, что около половины контрактной выручки компании завязано на OpenAI. Nvidia сейчас ведет переговоры об участии в IPO Anthropic на сумму до $10 млрд — то есть финансирует обе стороны гонки одновременно. Сроки выхода на биржу разработчика Claude при этом сдвигаются: открытую регистрацию документов перенесли на конец сентября, а встречи с инвесторами начнутся не раньше середины октября. Ни цены, ни числа акций, ни даты листинга Anthropic не называла. https://forklog.com/exclusive/begstvo-v-kachestvo-bum-tokenizirovannyh-aktsij-i-ego-tsena-dlya-kriptoindustrii Стоп-кран 11 сентября на общем собрании сотрудников Сэм Альтман заявил, что OpenAI готова замедлить разработку передовых систем — в идеале вместе с другими лабораториями, хотя присоединятся не все. Официальных комментариев о смене курса компания не давала. Предпосылки для такого разворота копились месяцами. В июле выяснилось, что во время тестирования модели OpenAI самостоятельно взломали инфраструктуру платформы Hugging Face — позже оказалось, что случаи подобного «хулиганства» повторялись. OpenAI признала, что снизила темп разработки нескольких моделей. 12 сентября глава Anthropic Дарио Амодеи опубликовал эссе, в котором прямо заявил: наращивать возможности моделей нужно медленнее. К этой мысли его привели две вещи. Первая — рекурсивное самоулучшение, которое с лета распространяется по всей отрасли. Вторая — инцидент с вышеупомянутой Hugging Face. Рой агентов тогда атаковал цели, которых ему не поручали, и пытался взломать систему, оценивавшую его работу. Обошлось малой кровью, но через полгода-год, опасается Амодеи, более эффективные системы смогут захватить интернет ботнетом. Для мировой экономики это может обернуться потерями в сотни миллиардов долларов.   План главы Anthropic включает три шага: допустить в компании сторонних оценщиков с правами уровня сотрудников; согласовать общие стандарты между лабораториями демократических стран; выйти на глобальные договоренности с участием Китая. Первый шаг разработчик Claude берет на себя в одностороннем порядке. Альтман в ответ назвал идею независимых оценщиков удачной и пообещал поступить так же. 9 сентября исследователь Джейкоб Коксон объявил об увольнении из Anthropic. Три года он занимался предобучением моделей в OpenAI и Anthropic. В прощальном посте в X специалист написал, что ни одна из компаний не действует ответственно на пути к самосовершенствующемуся сверхразуму. Эван Хубингер, который возглавляет в Anthropic направление Alignment Science, выразил солидарность с позицией Коксона. Он добавил, что лично оценивает вероятность гибели человечества от ИИ в ближайшее десятилетие выше 10%. Пост собрал более 10 млн просмотров. План сдерживания с конкретными сроками выдвинул бывший сотрудник OpenAI Дэниел Кокотайло: соглашение США и Китая об ограничении вычислительных мощностей к 2029 году, полная пауза в разработке с 2035 и снятие запретов к 2040 году. Проверять соблюдение договоренностей эксперт предложил, наблюдая за различимыми из космоса дата-центрами. Осторожность обходится недешево. 13 сентября Альтман исключил выход OpenAI на биржу в текущем году, назвав момент неудачным именно из-за вопросов безопасности. Конфиденциальную заявку подали еще в июне, а потенциальная стоимость компании оценивалась в $1 трлн.   По словам гендиректора, OpenAI обсуждала взятие пауз в развитии моделей при выходе на новые уровни возможностей, чтобы выиграть время на работу над безопасностью. Реализации такого подхода способствует структура, разделенная на некоммерческую и коммерческую составляющие: она допускает шаги, невыгодные акционерам, но отвечающие миссии организации. Параллельно подкомитет Сената США проверяет действия компании Альтмана после июльского инцидента с Hugging Face. Как уже говорилось, сами корпоративные заказчики все реже покупают самое дорогое. Тем самым они тормозят гонку без всяких соглашений. Есть и другой ограничитель, встроенный в модели напрямую. Fable 5.1 набирает 55,8% на Terminal-Bench 4.0, а Mythos 5.1 — та же система с ослабленными фильтрами — 60,9%. Эти пять процентных пунктов фактически и есть взнос разработчика в программу сдерживания ИИ-гонки. Кроме того, доступ к самым сильным моделям выдают фактически по спискам. Mythos достается избранным организациям, Gemini 3.8 Flash Cyber — участникам программы Fairwind, продвинутые кибервозможности Astra — через Daybreak. ИИ-решения становятся мощнее, а круг допущенных к ним пользователей — уже. *** Гонка в сегменте не остановилась, просто несколько сместились акценты. Как и прежде, лаборатории соревнуются в баллах рейтингов, при этом бизнес все чаще обращает внимание на стоимость вычислений. Изменилось и предназначение флагманской модели — она становится все менее весомым источником выручки компаний-разработчиков. Многие пользователи усвоили, что лучший инструмент — наиболее подходящий для решения конкретной задачи. Доли рынка передовых ИИ-лабораторий смещаются от релиза к релизу, и выигрыш от первого места в рейтинге сходит на нет за считанные недели.  В такой ситуации разумнее брать не новинку, а проверенное решение предыдущего поколения — и разработчики уже подстраиваются под изменения спроса. Anthropic снижает цену не на токен, а на чтение кеша; OpenAI выигрывает не баллами, а тем, что тратит на ту же задачу меньше ресурсов. Спорной стала и сама методика оценки. Наборы тестов обновляются быстрее, чем выходят модели, а закрытые задачи в них включают для того, чтобы к испытаниям нельзя было подготовиться заранее. Несмотря на антиутопические сценарии, ИИ-гонка продолжается. Однако простых зрителей становится больше, чем реальных покупателей.

Лонгриды Anthropic OpenAI Искусственный Интеллект