Как мы все недооценили Grok Build и почему скоро не будет Cursor

Если, конечно, Маск не слукавил.
Под видом grok-4.5 на LLM Arena, по наблюдениям комьюнити, уже около недели крутится то, что тестеры называют Grok 4.6. Параллельно xAI собирает связку Grok Build, Workflows, Grok Bot, Grok Imagine Image 2.0 и обновлённый harness.
А ну и стоит помнить что Grok Build опенсорс на Rust с топовым UX и производительностью.
Вот это уже похоже на систему. Контур, где модель видит репозиторий, дергает инструменты, запускает shell, проверяет результат, распараллеливает исследование, ходит по сайтам через Bot, разбирает картинку на редактируемые области и собирает ассеты/видео.
1. Arena: Grok 4.6 прячется под бейджем Grok 4.5
11 августа Harshith показал четыре новых варианта grok-4.5 в Arena и предположил, что это Grok 4.6 с разными уровнями reasoning effort. Официальной карточки grok-4.6 пока нет. В docs.x.ai на 12 августа есть Grok 4.5, но нет отдельного model ID, цены, SLA и release notes для 4.6.
Это не мешает сделать практический вывод: xAI тестирует новый класс поведения на живой арене, не в красивом лендинге.
Скриншот из треда Harshith: новые варианты grok-4.5 и гипотеза про Grok 4.6.
Почему это важно? Потому что Arena-паттерн у xAI уже был: сначала тихий прогон, потом публичное имя. Если сегодня Маск опять не пролетит мимо собственного дедлайна, мы можем увидеть не “ещё одну модель”, а модель, заточенную под agentic coding и visual app generation.
2. 3D с нуля: WDP-4D и Voxelcraft
Самый сильный сигнал из X-тредов — не текстовый benchmark. Это one-shot генерация интерактивных 3D-сцен.
Промпт Harshith: Indian Railways WDP-4D dual-cab diesel locomotive model using Three.js. На low reasoning модель собирает рабочий 3D-локомотив с характеристиками. На medium добавляет интерфейс, переключатели видов, техническую панель. На high/xhigh локомотив уже визуально ближе к реальному объекту: маркировка, кабины, тележки, параметры тяги.
WDP-4D, low reasoning. Оригинальный ролик.
Medium-вариант: уже не “моделька”, а маленькая техническая студия вокруг объекта.
High/xhigh по подписи автора. Сравнение с low.
Второй тест — Voxelcraft, Minecraft-подобный мир. Там интересен уже не один asset, а связность: меню, управление, блоки, дневная и ночная сцены.
Voxelcraft day из поста J A Z I I.
Ночная сцена из продолжения треда.
Раньше такие демки у моделей обычно разваливались на двух местах: либо геометрия была “ну, вроде похоже”, либо интерактив ломался после первого клика. Здесь виден другой класс ответа: модель собирает объект, сцену, UI и поведение в один runnable-прототип.
Это ровно то, чем должен заниматься app builder.
3. Cursor-данные: топливо для агентной модели
Cursor пишет прямо: Grok 4.6 обучали вместе со SpaceXAI, в обучение вошли триллионы токенов Cursor-данных. Внутри не один код: там следы работы разработчиков, как они ходят по репозиторию, какие инструменты вызывают, где ошибаются, как чинят, как проверяют результат.
Вот почему фраза “Cursor really saved Elon huh” из комментариев смешная, но не совсем шутка.
Такие данные стоят дороже красивых задач из учебника. В них есть грязная разработка: поломанные окружения, странные зависимости, неполные требования, агенты, которые тупят, и люди, которые их поправляют. Если модель реально учится на этом классе траекторий, она оптимизируется не под “ответить умно”, а под “дотащить задачу”.
Сноска для душных: Cursor отдельно признал contamination-риск. Ранний snapshot кодовой базы Cursor случайно попал в training data и мог дать Grok 4.5 преимущество на CursorBench. Данные удалили для будущих моделей. Поэтому утверждать “Grok 4.6 обучен на всей выборке Cursor” нельзя. Но тезис про триллионы токенов developer-agent interactions подтверждён Cursor.
4. Time-to-verified-result важнее TPS
Официальная цифра xAI для Grok 4.5 — около 80 tokens per second. Цена — $2 за миллион input-токенов и $6 за миллион output-токенов. На SWE-Bench Pro xAI показывает 15 954 output-токена на задачу против 67 020 у Opus 4.8 max, то есть примерно в 4,2 раза меньше output budget.
Artificial Analysis даёт ещё более прикладную метрику: Grok 4.5 в Grok Build стоил около $2.49 за задачу в их Coding Agent Index. Для сравнения: GPT-5.5 в Codex — $5.07, Fable 5 в Claude Code — $11.80.
Здесь нужна нормальная PM-метрика:
time_to_verified_result =
время модели + tool calls + тесты + ретраи + ревью человеком
cost_per_task =
input + cached input + output + tool calls + ретраи + цена проверки
TPS сам по себе мало что говорит. Быстрая модель, которая три раза чинит собственный мусор, проиграет более медленной модели, если та дошла до зелёных тестов за один проход.
Grok 4.6 должен побить этот уровень. У Grok сейчас сильная заявка именно на task economy: низкая цена токенов, меньше output-токенов, быстрый inference и harness, который умеет проверять работу.
5. Grok Build: аналог Гермеса на токенах подписки Grok
Вот часть, которую легко недооценить.
Grok Build легко принять за “терминальчик для промптов”. Ошибка. В репозитории xai-org/grok-build лежит Rust TUI и agent runtime: интерактивный режим, headless-режим для скриптов/CI, Agent Client Protocol для встраивания в редакторы, shell, файловые правки, поиск, MCP, skills, hooks, plugins, sandbox, permissions, subagents.
По сути, это управляемый harness вокруг модели.
Грубая аналогия: если Hermes для вас был “агентом, который живёт в проекте и сам себя контролирует”, то Grok Build идёт в ту же сторону, только на токенах подписки Grok и с официальной xAI-моделью внутри.
В 1.0.0 и соседних релизах xAI докручивала не маркетинговые бантики, а рабочую механику:
-
permission prompt показывает нормальные shell-команды;
-
MCP-изображения чинятся и передаются без странных обрывов;
-
sandbox лучше живёт в больших директориях;
-
фоновые задачи можно отменять;
-
queued prompts и
/btwдают писать агенту по ходу работы; -
remote resume не пытается магически откатить код;
-
plan/agent/ask стали предсказуемее;
-
большие git-репозитории меньше ломают контекст.
Это скучные пункты. Поэтому они важные. В агентной разработке выигрывает не тот, кто красиво отвечает в чате, а тот, кто меньше ломает рабочий цикл.
6. Workflows: 128 агентов, а на больших задачах до 1024
Workflows в Grok Build — отдельный нерв. xAI описывает их как фоновые сценарии, где Grok сам планирует фазы, распараллеливает работу между агентами, проверяет выводы и собирает отчёт.
Лимит из анонса: 128 агентов на обычный workflow, до 1024 на большие задачи.
Пример: ревью большого PR. Один агент собирает контекст, несколько ищут риски по доменам, отдельные проверяют найденные баги, финальный собирает ranked report. Для PM-аудита это вкусно: можно гонять не “попроси модель посмотреть PR”, а воспроизводимый процесс с фазами, проверками и бюджетом.
/deep-research туда же. Исследование дробится на параллельных расследователей, потом утверждения сверяются с источниками. Для статьи, ресерча рынка, due diligence или разбора конкурентов это почти готовая фабрика черновиков. С человеческой верификацией, разумеется. Руки от руля пока не убираем.
7. Grok Bot: свой Hermes
Grok Bot анонсировали 11 августа. Это уже не локальный coding agent, а always-on teammate на persistent cloud computer. Бот может работать в браузере, с файлами, командной строкой, коннекторами и сайтами, где нет нормального API или MCP.
Вот тут я до этого срезал углы. По свежим docs картина шире:
-
desktop app есть для macOS и Windows;
-
companion app есть на iOS, Android/iPad пока не заявлены;
-
вход идёт через Cursor account;
-
доступ: SuperGrok Heavy, Cursor Ultra, Cursor Teams Premium, плюс trial/командные варианты;
-
все боты пользователя делят один cloud computer;
-
внутри общего компьютера шарятся browser cookies, файлы, логины и command-line credentials;
-
каждый бот получает свой screen, несколько ботов могут работать параллельно;
-
закрытый ноутбук не останавливает background turn или routine.
Это важное отличие от “ассистента”. Ассистент отвечает. Bot должен довести работу до артефакта в реальном инструменте: CRM, Gmail, dashboard, staging UI, документ, spreadsheet, тикет.
xAI приводит внутренние сценарии: sales outbound, подготовка demo environment, CRM/org-chart hygiene, account follow-up, office ops, баг-репро в UI с передачей фикса debugging bot. Звучит как маркетинг, да. Но механика здравая: если нет API, бот смотрит в веб-интерфейс и работает там, где работает человек.
8. Grok Bot routines: показал один раз, потом оно ездит само
Самая недооценённая часть Bot — routines and skills. У Grok Bot есть два кирпича:
-
skill: сохранённая инструкция, как делать задачу;
-
routine: когда запускать workflow, по расписанию или событию.
Можно сделать задачу один раз, сохранить процесс как skill, добавить правила принятия решений, формат результата, approval boundaries, а потом повесить routine. В docs есть teach-by-demonstration: открыть компьютер бота, показать браузерный workflow до 10 минут, остановить запись, получить черновик skill и протестировать на безопасном примере.
Для операционки это сильнее, чем “запусти агента”. Это уже заготовка под повторяемый процесс:
-
каждый будний день собрать customer-risk watch list;
-
по Slack/GitHub событию открыть тикет и подготовить repro pack;
-
сверить spreadsheet с policy PDF и вернуть новый файл;
-
подготовить отчёт с direct source links, screenshots, timestamps и action log.
Тут же живёт риск. Все боты делят один компьютер, поэтому это не security boundary. Отдельный бот не защищает один логин от другого. Для чувствительных действий нужны approvals, scoped service accounts, read-only старт, запрет на отправку внешних сообщений без подтверждения, чистка /workspace и ревок коннекторов после проекта. По-менеджерски скучно, но иначе потом будем писать пост “как мы случайно дали агенту бухгалтерию и Slack”.
Связка получается занятная:
-
Grok Build работает в репозитории;
-
Grok Bot работает в SaaS-интерфейсах, файлах и браузерных рутинах;
-
Workflows распараллеливают большие задачи;
-
Grok 4.5/4.6 тащит рассуждение и код.
Это уже похоже на операционную систему для knowledge work. Сырая? Конечно. Но направление понятное.
9. Grok Imagine Image 2.0: сегментация, ассеты и layer focus
Imagine закрывает визуальный слой, и я его до этого описал преступно коротко. 7 августа xAI анонсировала Imagine Image 2.0. В API модель доступна как grok-imagine-image-2.0. В официальном посте важны не красивые картинки, а инструменты правки:
-
magic wand редактирует область, на которую указываешь, и не трогает остальное;
-
segmentation выбирает точные области изображения для изменения;
-
background removal экспортирует subject с прозрачным фоном;
-
multi-ref editing принимает до 5 входных изображений в одной генерации;
-
smart resize меняет ratio и достраивает кадр;
-
templates закрывают типовые пайплайны: photo edit, product color change, e-commerce photos, professional headshot, icon maker, character sprite, props & UI kit, mascot maker, merch maker.
Вот здесь и появляется layer focus. Даже если xAI не называет это отдельной кнопкой “layers”, продуктовая функция уже похожа на разбор картинки на рабочие сущности: объект, фон, область правки, reference, проп, персонаж, UI kit. Background removal даёт прозрачный asset. Segmentation даёт точную область вмешательства. Multi-ref позволяет собрать композицию без ручного коллажа.
Для дизайна и app generation это не “сделай красивую картинку”. Это pipeline:
-
сгенерировал героя;
-
вырезал subject в прозрачный asset;
-
отдельно сгенерировал props;
-
отдельно сделал location;
-
собрал UI kit;
-
прогнал smart resize под сторис, баннер, лендинг;
-
отправил кадр в image-to-video/reference-to-video.
xAI сама показывает направление “build a world for video”: персонаж, локации и props генерируются отдельно, но держат один стиль. Это уже ближе к production asset pack, чем к одноразовой картинке для поста.
10. Grok Imagine против OpenAI Image: где реально сравнивать
По уровню притязаний Imagine Image 2.0 вышел на территорию OpenAI Image: точность правок, сохранение сцены, работа с текстом, последовательные изменения, сборка композиции из нескольких references. xAI заявляет, что Image 2.0 был вторым в мире и по text-to-image, и по image editing в Arena-лидербордах на 7 августа. Проверять это надо на одинаковом протоколе, не на вкусовщине.
Я бы проверял Grok Imagine не “красиво/некрасиво”, а так:
-
заменить один объект и не убить фон;
-
выделить subject и выгрузить asset с прозрачным фоном;
-
сегментировать одежду/предмет/фон и поменять только эту область;
-
сохранить персонажа через пять итераций;
-
собрать сцену из пяти references;
-
поправить текст на картинке;
-
сделать набор props/UI kit в одном стиле;
-
превратить asset в короткое видео без каши на движении.
Именно поэтому Imagine нужен в статье про Grok Build. Если Build генерирует приложение, а Imagine генерирует и режет ассеты, то связка закрывает код и визуальный production loop.
Вывод
Grok Build недооценили, потому что смотрели на него как на ещё один coding CLI. А надо смотреть как на harness вокруг модели, которая обучалась на реальных developer-agent траекториях и теперь получает продуктовые руки: Bot, Workflows, Imagine, Build Mode, API, Cursor.
Сильная штука здесь именно в сборке:
-
модель быстро и дёшево генерирует;
-
Cursor-данные учат её реальному процессу разработки;
-
Grok Build даёт контроль над репозиторием и инструментами;
-
Workflows превращают одну задачу в многоагентный процесс;
-
Bot тянет рутину там, где нет API, и делает это в реальных инструментах;
-
Imagine режет визуал на области, вынимает ассеты, держит references и ведёт к видео;
-
Arena, похоже, уже показывает следующий уровень под старым именем.
Если всё это сойдётся, Grok станет не “альтернативой Cursor”. Cursor окажется одним из клиентов к более большой агентной машине.
P.S. Автор оставляет за собой право быть неправым. Особенно если Маск сегодня опять сделал вид, что календарь — это рекомендательная система.
Источники
Автор: Renewal_Studio

