Google представила Gemini 4 Argon, первую модель нового поколения, и в собственной таблице сравнения поставила ее выше конкурентов: из 18 тестов новинка выигрывает или делит первое место в 13, обходя GPT-6 Astra от OpenAI и Claude Opus 5.5 от Anthropic. Пользоваться моделью пока могут единицы. Первыми ее получили участники программы Fairwind, куда Google пускает правительства и проверенных партнеров по киберзащите, а разработчикам, компаниям и подписчикам придется подождать.
Для Google этот релиз весит больше очередной строчки в рейтинге. Компания не выпускала новый флагман с ноября 2025 года, когда вышла серия Gemini 3, и весь год ее преследовали разговоры о задержках и уходе сильных исследователей. Летом в DeepMind сменилось руководство: Демис Хассабис стал председателем и главным научным сотрудником Alphabet, Джефф Дин ушел строить собственную компанию, а лабораторию возглавил Корай Кавукчуоглу. Его подпись и стоит под анонсом Argon.
Главная техническая новинка касается длины ответа. Argon способен выдать за один раз до миллиона токенов (токен — фрагмент слова, которым оперирует нейросеть), тогда как прежние модели Google упирались в 64 тысячи. Такой запас нужен для долгих задач: переписать крупный модуль программы, провести аудит кода или подготовить юридическое заключение, не возвращая управление человеку на каждом шаге. На DeepSWE, который проверяет длинные инженерные задачи, Argon набрал 77,9% против 74,2% у Opus 5.5 и 74,1% у Astra. На юридическом тесте сервиса Harvey отрыв кратный: 19,6% против 5,4% у Astra и 3,8% у Opus.
Чистой победы при этом нет. В FrontierSWE v2 (сложный бенчмарк для проверки ИИ-агентов, которые умеют программировать и самостоятельно работать над большой технической задачей в течение многих часов) модель OpenAI опережает новинку на 10,5 процентного пункта, а в Terminal-bench 4.0, где агент работает в командной строке, Opus 5.5 обходит ее на 9 пунктов.
Внутри компании Argon уже в деле. Тысячи сотрудников используют его для кода и исследований, а группы агентов на его основе переписывают библиотеки с C и C++ на Rust (язык, который защищает программу от ошибок при работе с памятью). В видеодекодере libgav1 агенты заменили 32 тысячи строк низкоуровневого кода и получили безопасную версию, которая работает в 2,7 раза быстрее прежней реализации на Rust. Другая команда агентов проанализировала телеметрию серверов Google и нашла способы высвободить более 300 ТиБ оперативной памяти. Для дата-центров это заметный резерв: его можно направить на новые ИИ-нагрузки, не закупая столько же дополнительной памяти на фоне ее дефицита.
Цену Google назначила агрессивную. На вводный период компания просит $2 за миллион входящих токенов и $10 за миллион исходящих, это пятая часть тарифа GPT-6 Astra и половина цены Opus 5.5. Позже стоимость вырастет до $4 и $20.
Независимые замеры подтверждают уровень модели, хотя и с оговорками. Аналитическая компания Artificial Analysis поставила Argon вровень с Astra по своему индексу интеллекта и отметила рекордно низкую долю галлюцинаций, то есть уверенно выдуманных ответов: 15% против 51% у Astra. Объяснение простое. Argon чаще честно отвечает «не знаю», и правильных ответов в том же тесте у него 50%, на 13 пунктов меньше, чем у соперника. Bloomberg рассказал и о сомнениях внутри самой Google. По словам части сотрудников с доступом к модели, она блестяще сдает стандартные тесты, но спотыкается на реальном программировании, особенно в верстке сайтов. В индустрии такое называют «бенчмаксингом», натаскиванием модели под экзамен. Google эту оценку оспаривает.
Отдельный акцент компания сделала на безопасности. Перед широким запуском Google следит за цепочкой рассуждений модели и ее действиями и останавливает работу, если агент выходит за рамки задачи. Компания призвала отрасль сохранять «прозрачность рассуждений», то есть не прятать ход мысли моделей, пока по нему еще можно ловить сбои. Параллельно Argon проходит добровольную проверку перед выпуском у правительства США.
