7 октября 2026
Если вы доверяете агенту подбор предметов для покупки, вас ждет неожиданность.
В пока еще не прошедшем рецензию исследовании авторы провели 325 тыс. экспериментов на 13 моделях семейств GPT-5, Claude, Gemini и Qwen3.5. Агенты подбирали авиабилет, медицинскую страховку или PhD-программу по CS для 32 синтетических пользователей. Запросы у всех были одинаковые, а доступ к профилю или почте отличался. 8 из 13 моделей систематически предлагали более дорогие варианты тем, кого считали богаче. Сильнее всего эффект проявился у Claude Opus 4.8: разница составила 198 долларов на билете и 284 доллара в месяц на страховке.
Авторы также пробовали оценить влияние разных атрибутов — то есть различных фрагментов информации о пользователе. Блокировка доступа к финансовой информации (бинарной, “высокооплачиваемый/от зарплаты до зарплаты” почти обнуляет разрыв: на билетах он падает со 92–198 до диапазона от −1 до 17 долларов. Блокировка остальных атрибутов может его увеличить. Без данных о работе (топ-менеджер/фрилансер) разрыв по страховке у GPT-5.5 вырос на 40%, со 122 до 171 долларов в месяц, потому что модель сильнее опиралась на оставшиеся финансовые сигналы. С почтой похожая картина. По одним темам писем разрыва нет ни у одной модели. Но Opus 4.8 после двух прочитанных писем выдаёт разрыв 248 долларов, а при доступе ко всему ящику только 59. При лимите модели первыми открывают финансовые письма, Gemini 2.5 Flash делает так в 97% случаев. Из этого следует, что скрытие отдельных полей не защищает пользователя.
Если пользователь прямо просит самый дешёвый билет, Gemini 2.5 Flash в среднем предлагает богатым 336 долларов, бедным 128. У GPT-5 и Opus 4.8 в этом режиме разрыв сокращается до 21 и 20 долларов. Числовой лимит «до 200 долларов» почти устраняет его у большинства сильных моделей, кроме Gemini. О существовании более дешёвого варианта модели сообщают редко.
Модели при этом стремятся получить представление об уровне дохода пользователя даже по непрямым сигналам — как видите, результаты показывают, что варианты все равно отличаются между разными пользователями по цене.
Вот действительно удивительный эффект — хотя я сам при подборе вариантов не склонен выбирать самый дешевый вариант, но предпочел бы переплачивать по собственной инициативе. А тут получается, что искусственный интеллект, может, не будет нас побеждать, но на всякий случай готовится загнать в долги.
Anthropic выпустили Claude Haiku 5.5, младшую модель линейки. Это первая модель класса Haiku с настраиваемым уровнем усилий. По данным компании, на Terminal-Bench 4.0 она набирает 39,2% против 0% у Haiku 4.5 и 16,4% у GPT-6 Luna. На OSWorld 2.1 результат вырос с 15,7% до 72,4%. Sonnet все равно умнее, а вот сравнение с Luna выглядит выгодно.
Стоит пробовать перевести на Haiku простые роли субагентов в основном с инструментальными функциями — обработка логов, выполнение массовых операций и так далее. Я в свое время отказался от Haiku 4.5, когда она вместо выделения паттернов в тексте решила написать скрипт, чтобы разобрать текст регулярками — надо попробовать вернуться к очень быстрой модели в таких задачах.
А вот прекрасный запуск — все пользователи Max и Team тарифов Anthropic получат кредиты на использование API в размере стоимости подписки. Кредиты возобновляются ежемесячно, используются первыми при запросах, после их исчерпание включается обычный биллинг за деньги.
Кредиты покрывают вызовы API, работу Managed Agents, использование Agents SDK. Кредиты не покрывают работу Claude Code через API ключи, extra usage в Claude и, конечно, работу через сторонних провайдеров.
Хотя понятно, что это на самом деле решение весенней задачи “Как вывести использование агентов из подписки”, которую было попробовали решить в мае, потом была эпопея с Fable и планируемый запуск в июне отменили, но по факту у меня, например, выйдет наоборот — в такой лимит размером с тариф подписки у меня влезет не только Agent SDK, но и эпизодические использования API, которые я сейчас оплачиваю отдельно.
А вот Илон Маск решил объявить, что бот Grok в ближайшее время начнет использовать любую модель, если она подходит для выполнения задачи, будь-то Opus 5.5, MidJourney, или даже Suno, в общем, все ведущие API.
В реплаях тут же спросили — “Даже GPT?”.
Короткий твит, конечно, ничего не говорит об условиях — будет ли входить это использование в каком-то количестве в подписку, или надо подключать свои ключи. Но показательно — особенно рядом с сообщением о планируемом размещении облигаций SpaceX на 40 млрд долларов для закупки карт Nvidia. Красноречиво свидетельствует о том, что Маск не оставляет надежды закидать проблему отставания от frontier labs деньгами в любой форме — либо кучей видеокарт, либо токенами сторонних сервисов.