0:00
/0:15

Главный акцент Grok 4.6 — длинные агентные задачи: не просто написать функцию или ответить на вопрос, а получить большую цель, разобраться в незнакомом проекте, исследовать кодовую базу, предложить архитектуру, внести изменения, проверить себя и продолжить работу в несколько итераций. Cursor отдельно отмечает, что модель стала лучше справляться с длинными траекториями, прототипированием и визуальными интерактивными проектами.

Именно поэтому для меня Grok 4.6 интересен не столько как очередной чат-бот, сколько как новый рабочий агент внутри Cursor.

Что показывают бенчмарки

Самая интересная часть релиза — сравнительная таблица Cursor. В ней Grok 4.6 High поставили рядом с Grok 4.5 High, GPT-5.6 Sol Max и Fable 5 Max.
Benchmark Grok 4.6 High Grok 4.5 High GPT-5.6 Sol Max Fable 5 Max
AA Intelligence Index 61 56 61 62
GDPVal-AA v2 1753 1526 1728 1741
CursorBench v3.2 69.9% 66.7% 67.2% 70.5%
DeepSWE v1.1 65.9% 54% 73% 70%
FrontierCode v1.1 Extended 61.3% 56.6% 60.6% 64.9%
APEX-Agents 57.5% 47.1% 56.7% 59.2%
Terminal-Bench v3.0 26% 15.7% 34.6% 34.1%
APEX-SWE 56.4% 53.6% 58.8%
AA-Briefcase 1577 1313 1502 1574
Harvey LAB (Vals) 15.8% 12.9% 2.5% 11.3%

На общем Artificial Analysis Intelligence Index Grok 4.6 получил 61 балл. Это столько же, сколько GPT-5.6 Sol Max, и всего на один пункт меньше Fable 5 Max с результатом 62. Предыдущий Grok 4.5 имел 56. Artificial Analysis отдельно отмечает скачок на пять пунктов всего за одно поколение модели.

Но гораздо интереснее посмотреть не на один итоговый индекс, а на конкретные типы работы.

GDPVal-AA v2 — 1753. Здесь Grok 4.6 обходит и Fable 5 Max с 1741, и GPT-5.6 Sol Max с 1728. Это тест на агентную работу, приближенную к реальным интеллектуальным задачам, поэтому для меня этот показатель особенно важен. Artificial Analysis называет агентную производительность вообще одной из сильнейших сторон Grok 4.6.

На CursorBench v3.2 версия Grok 4.6 High показывает 69,9% против 66,7% у Grok 4.5, 67,2% у GPT-5.6 Sol Max и 70,5% у Fable 5 Max. То есть разница между Grok и Fable здесь уже практически исчезает. Причём актуальный CursorBench показывает ещё более высокий результат для режима Grok 4.6 Extra High — 70,8%, что сейчас ставит его даже выше Fable 5 Max и Opus 5 Max в этом тесте. CursorBench строится на неоднозначных многофайловых задачах из реальных сессий Cursor — редактировании, рефакторинге, поиске ошибок, понимании кодовой базы и использовании инструментов.

Есть тесты, где лидируют другие модели. Например, в DeepSWE v1.1 Grok 4.6 получает 65,9%, тогда как GPT-5.6 Sol Max — 73%, а Fable 5 Max — 70%. В Terminal-Bench v3.0 у Grok 26% против 34,6% у GPT-5.6 и 34,1% у Fable.

Но в других категориях Grok снова оказывается буквально рядом с лидерами: 61,3% в FrontierCode, 57,5% в APEX-Agents, 56,4% в APEX-SWE.

И есть ещё один очень показательный результат — AA-Briefcase: 1577. У Fable 5 Max здесь 1574, у GPT-5.6 Sol Max — 1502, а у Grok 4.5 было всего 1313. Artificial Analysis прямо относит Grok 4.6 в этом тесте к Fable 5-tier и отдельно отмечает эффективность модели на длинных агентных задачах: она приходит к результату за существенно меньшее количество шагов и входных токенов, чем некоторые более дорогие frontier-модели.

Даже в специализированном Harvey LAB, связанном с юридической агентной работой, в таблице Cursor у Grok 4.6 результат 15,8% — выше Fable 5 Max с 11,3%, Grok 4.5 с 12,9% и GPT-5.6 Sol Max с 2,5%.

Поэтому я бы вообще не пытался определить здесь одного абсолютного победителя. Картина интереснее: Grok 4.6 вошёл в очень небольшую группу моделей, которые в зависимости от задачи реально меняются местами на вершине таблицы.

А теперь самое интересное — цена

Базовая стоимость Grok 4.6 осталась такой же, как у Grok 4.5: $2 за миллион input tokens и $6 за миллион output tokens. Cursor также предлагает Fast-вариант в два раза дороже. Artificial Analysis отдельно подчёркивает, что при сопоставимой frontier-производительности Grok оказывается значительно дешевле ряда конкурентов.

А на первую неделю после запуска Cursor включил для Grok 4.6 2× usage внутри Cursor и Grok Build. Фактически для активного пользователя это почти эквивалент 50-процентному снижению стоимости работы модели: за тот же включённый usage можно сейчас прогнать примерно вдвое больше задач.

И вот здесь ситуация становится особенно интересной.

Модель примерно уровня Fable 5 уже можно просто посадить работать на свои проекты — причём сейчас ещё и с удвоенным usage.

Audit Canvas

Что произошло у меня после релиза

Я использую Grok 4.6 непосредственно внутри Cursor, поэтому после получения письма о релизе практически сразу бросил её на свои репозитории и текущие проекты.

Не на тестовый Hello World, а именно на существующие кодовые базы: разбираться в структуре, искать слабые места, проводить аудит, предлагать рефакторинг, смотреть на архитектуру целиком.

И первые результаты мне очень нравятся.

Особенно хорошо сейчас работает режим аудита. Модель не ограничивается несколькими очевидными замечаниями, а действительно начинает проходить проект системно. После исследования репозитория она собирает Audit Canvas — фактически карту найденных проблем и потенциальных улучшений — и там появляется неожиданно много полезных вещей: архитектурные упрощения, дублирование логики, старые решения, которые уже можно удалить, возможности для нормального рефакторинга, проблемы структуры компонентов и места, которые самому легко месяцами не замечать.

Причём мне нравится именно характер её работы. Она сначала довольно глубоко разбирается в существующем проекте, а уже потом предлагает изменения. Для больших живых репозиториев это намного ценнее способности сгенерировать красивый кусок кода с нуля.

Сейчас я продолжаю прогонять через неё свои проекты и смотреть, где проходят реальные пределы модели. Пока впечатление очень хорошее: Grok 4.6 внутри Cursor уже ощущается не как помощник программиста, которому нужно выдавать мелкие задачи, а как ещё один достаточно сильный инженер, которому можно отдать целое направление работы.

И, пожалуй, именно это сейчас происходит с AI-разработкой быстрее всего. Мы всё меньше обсуждаем, какая модель лучше отвечает на вопросы, и всё больше — какую часть реальной работы можно целиком передать агенту и утром посмотреть, что он сделал.