Grok 4.6 вышел на первое место в CursorBench 3.2: 70,8% при $2,81 за задачу
Если модель показывает почти лучший результат, но при этом тратит заметно меньше денег и шагов на задачу, это уже влияет на экономику реальной разработки. Для команд и для соло-разрабочиков — это вопрос себестоимости итераций.
CursorBench — это тесты моделей близкие к реальной разработке в IDE: модель должна разбираться в кодовой базе, вносить правки в несколько файлов, использовать инструменты, искать баги, рефакторить и доводить задачу до рабочего состояния.
Если смотреть шире, у Grok 4.6 сильные результаты и на других тестах:
- 88,2% на LiveCodeBench;
- 95,6% на SWE-bench Verified;
- 94,7% на GPQA Diamond.
Для себя я бы сформулировал это так. Grok 4.6 сейчас выглядит как очень сильная модель для прикладной инженерной работы, особенно там, где задачу можно описать через критерии приёмки, прогнать через тесты, проверить линтером и быстро понять, рабочее решение получилось или нет. В таких сценариях его сочетание качества и стоимости действительно выглядит очень сильным.
Где это особенно может работать на практике: типовые backend- и frontend-задачи, API-интеграции, CRUD-логика, миграции, тесты, документация, исправление багов, пакетные правки по репозиторию. Там, где нужен быстрый и аккуратный инженер.
А вот для архитектуры, спорных решений, длинного контекста и задач, где модель должна держать в голове много ограничений и неочевидных последствий, я бы всё ещё осторожно сравнивал её с Opus и другими сильными моделями на реальной работе, а не только по таблице.