Помните исследование про «ИИ замедляет на 19%»? Его повторили — и оно сломалось

В июле 2025 г. METR опубликовал результаты эксперимента с участием 16 опытных Open source-разработчиков. Для исследования использовали задачи из их собственных репозиториев, а участников случайным образом разделили на две группы: «с ИИ» и «без ИИ». Результат показал, что работа с использованием ИИ оказалась на 19% медленнее. При этом участники были уверены, что стали быстрее на 20%. С тех пор цифру «минус 19%» приводят в спорах о том, действительно ли ИИ помогает программистам.

После этого METR выпустил ещё два поста на ту же тему: в феврале 2026 г. — о повторном эксперименте с 57 разработчиками, в мае — о результатах опроса 349 человек. Февральский пост называется «Мы меняем схему эксперимента про продуктивность разработчиков», и посвящён не новым цифрам, а объяснению, почему старый метод перестал давать надёжные результаты. Ниже представлены все три публикации по порядку с цифрами и выводами, которые складываются при их последовательном прочтении.

Июль 2025 г.: что вообще измеряли?

Напомню условия эксперимента, потому что они важны в дальнейшем.

Кто и где:

  • 16 разработчиков, у каждого в среднем опыт работы пять лет и около 1,5 тыс. коммитов в собственном репозитории

  • Репозитории в среднем существуют около десяти лет и содержат более 1 млн строк

  • 246 задач: примерно половина оформлена как Issue в репозитории, остальные созданы специально для эксперимента (подробнее — в сноске 4 статьи)

Как:

  • Каждую задачу случайным образом относили к условию «ИИ разрешён» или «ИИ запрещён»

  • Экраны участников записывались

  • В основном использовался инструмент Cursor Pro с Claude 3.5/3.7 Sonnet, при этом 56% участников до эксперимента не применяли Cursor

  • Оплата составляла $150 в час

Что ожидали и что получили:

  • Участники прогнозировали ускорение работы с ИИ на 24%

  • Экономисты, опрошенные отдельно, ожидали ускорение на 39%, а ML-эксперты — на 38%

  • По факту задачи при условии «ИИ разрешён» выполнялись на 19% дольше (доверительный интервал — от +2% до +39%)

  • После эксперимента участники по-прежнему считали, что ИИ ускорил их работу на 20%

В статье на arXiv авторы рассмотрели 21 возможную причину (не спрашивайте — в блоге упоминается 20). Пять из них подтвердились:

  1. Разработчики переоценивали пользу ИИ

  2. Они слишком хорошо знали свой код

  3. Репозитории были большими и сложными

  4. ИИ оказался ненадёжным: участники принимали менее 44% его предложений, а около 9% времени уходило на проверку и исправление

  5. ИИ не видит неявного контекста проекта

По десяти причинам данных не хватило, а шесть были отвергнуты.

И один из абзацев из FAQ в блоге, на который тогда почти никто не обратил внимание. Здесь и дальше перевод мой:

Возможно, есть опытные Open source-разработчики, которые решили не участвовать, потому что верят в значительное ускорение работы от ИИ и не хотят, чтобы их заставляли работать без него при решении половины задач. Никто из участников о таких мотивах не сообщал, но исключить это (как и другие смещения выборки) мы не можем.

Второй набор начался через месяц, и это стало главной проблемой.

Февраль 2026 г.: повтор

Второй набор начался в августе 2025 г.

  • Десять человек из первого исследования и 47 новых разработчиков из более разнообразных проектов, включая небольшие и молодые

  • Всего — 57 разработчиков, 143 репозитория и более 800 задач

  • Оплата была снижена до $50 в час

  • Что касается инструментов, METR отмечает, что за 2025 г. среди Open source-разработчиков резко выросло использование агентов вроде Claude Code и Codex

Результаты:

  • У десяти «старых» участников задачи с ИИ теперь занимали на 18% меньше времени (диапазон — от −38% до +9%)

  • У 47 новых — на 4% меньше (диапазон — от −15% до +9%)

Оба интервала содержат ноль. METR формулирует это как «слабое свидетельство ускорения» и не рассматривает −18% в качестве результата. Вместо этого весь пост посвящён причинам ухудшения качества выборки. В резюме выделены три причины:

1. Разработчики всё чаще отказываются участвовать. Дословно: «Растущая доля разработчиков говорит, что не хочет делать 50% своей работы без ИИ — даже за $50 в час за задачи, которые они выбирают сами». METR подчёркивает, что исследование «систематически теряет разработчиков с самыми оптимистичными ожиданиями от ИИ». Один из участников первого набора ответил на приглашение так:

Я разрываюсь. Хотел бы помочь с обновлёнными данными по этому вопросу, но мне очень нравится работать с ИИ!

2. Оплата. Ставка была снижена втрое, что тоже отпугнуло многих. METR прямо указывает на это и не скрывает за первой причиной.

3. Время стало трудно измеримым. У некоторых участников агент работает над одной задачей, а человек в это время берётся за другую. Что писать в графу «часы» — непонятно.

Что касается тех, кто остался, то в опросе 30—50% участников признались, что не включают в эксперимент часть задач, потому что не хотят выполнять их без ИИ. Один из новых участников отметил (многоточие — купюра METR):

Я заметил, что на самом деле сильно смещаю выборку задач… Избегаю задач, которые ИИ сделает за два часа, а я — за 20. Будет очень больно, если выпадет «без ИИ».

Другой сравнил работу без использования ИИ с пешей прогулкой через весь город, когда привык вызывать Uber. Еще один участник не выполнил ни одной задачи из тех, что ему выпали в режиме «без ИИ». METR относит это к «менее серьёзным» проблемам — формально речь идёт всего об одном человеке. Однако именно так в 2025 г. мог выглядеть тот самый неучтённый разработчик из FAQ.

Что METR из этого выводит:

  • Отбор участников пока затрагивает «меньшинство разработчиков и задач, что ограничивает величину смещения». Эксперимент не превратился в мусор.

  • Однако оценка −18%/−4% скорее является нижней границей. Настоящий эффект «может быть намного выше» у тех, кто выпал из эксперимента.

  • Главная причина отбора — рост ожиданий от ИИ у разработчиков. И дальше: «По мере роста возможностей ИИ и ожиданий разработчиков эти эффекты будут только усиливаться, всё больше ограничивая валидность такой схемы.

То есть, чтобы измерить, ускоряет ли ИИ программиста, необходимо, чтобы программист иногда работал без ИИ. В начале 2025 г. за $150 в час на это соглашались, в конце 2025 г. за $50 согласившихся стало меньше, а те, кто согласился, скрывают задачи. METR предлагает бороться с этим с помощью коротких интенсивных экспериментов с высокой оплатой. Возможно, это поможет, но тренд они сами описали.

Май 2026 г.: опрос вместо эксперимента

Поскольку с экспериментом возникли сложности, METR решил спросить напрямую.

Кого спрашивали:

  • 349 технических работников (после отсева десяти анкет с противоречивыми ответами)

  • Среди них — 87 инженеров, 71 исследователь, 129 академиков и аспирантов, 48 фаундеров и менеджеров

  • Половина регулярно пользуется Claude Code

  • Выборка «удобная»: GitHub, университетские списки, знакомые сотрудников METR, X (доля ответивших составляла около 2%, а 70% респондентов получили вознаграждение в размере около $200)

METR, перечисляя всё это, а то же время сам отмечает, что «результаты, вероятно, страдают от существенного смещения выборки».

Что ответили:

  • Медианная оценка ускорения — в 3 раза

  • Рост ценности работы — в 1,4–2 раза, в зависимости от формулировки вопроса (METR специально разделяет понятия «скорость» и «ценность»: быстро сделать ненужный дашборд — это скорость, а не ценность)

  • Тот же вопрос о ценности: март 2025 г. — 1,3 раза, март 2026 г. — 2, прогноз на март 2027 г. — 2,5

  • Медианный респондент готов отдать 29% зарплаты за месяц доступа к ИИ — эту оценку METR называет слабой, поскольку зарплаты респондентов прикидывала языковая модель

Далее METR объясняет, почему к результатам стоит относиться с осторожностью. Не «не верим», а «есть предварительные основания для скепсиса» — именно так они формулируют позицию. Вот три наблюдения.

Первое: самые низкие оценки из всех подгрупп дали сотрудники самого METR. Авторы рассматривают четыре объяснения и «слабо склоняются» к первому (сотрудники помнят прошлогодний разрыв между ощущением и измерением). Этот разрыв METR оценивает в среднем в 40 процентных пунктов по разработчикам (по агрегатным результатам выходит 39, но расчёт ведётся по каждому участнику).

Второе: семь респондентов заявили рост ценности в 10 раз и больше. METR проанализировал каждого из них.

  • У двух проверили публичные результаты работы — «уверены, что оба преувеличивают; по крайней мере, в разы более ценная работа снаружи не видна»

  • Два участника вызывают «некоторые подозрения»

  • По двум участникам данных нет

  • Один, по мнению METR, действительно выполняет через агентов впечатляющий объём работы, хотя это скорее про количество, чем про ценность

Третье: итоговое. Такие средние показатели «не выглядят неправдоподобными», но «есть реальная вероятность, что респонденты дают большие числа, чем дали бы, подумав дольше».

Что я из этого понял

В 2025 г. разработчики думали, что искусственный интеллект ускорил их работу на 20%. Однако по замерам секундомера они стали медленнее на 19%. Ошибка была не в цифре, а в направлении.

В 2026 г. повторить такие измерения стало сложнее. Всё больше разработчиков отказываются работать без ИИ за предлагаемое вознаграждение, а те, кто согласился, скрывают от эксперимента задачи, в которых ИИ особенно эффективен. При этом сами разработчики оценивают ускорение в 3 раза.

Вопрос «заменит ли ИИ программиста?» в таком виде не решается вообще, и три поста METR говорят не про замену, а про ускорение. Но они дают понимание самого вопроса. Он предполагает, что можно взять программиста, отобрать у него ИИ и посмотреть, что изменится. В начале 2025 г. такой эксперимент удалось провести. К концу 2025 г. контрольная группа начала распадаться, и METR ожидает, что дальше ситуация будет только ухудшаться.

Это не значит, что измерять больше нельзя. Существуют другие RCT — Peng et al. с Copilot, внутренний эксперимент Google, — но они проводились на простых или Greenfield-задачах, что METR и отмечает в своей статье. Кроме того, METR перечисляет шесть направлений для будущих исследований:

  • Интенсивные эксперименты с высокой оплатой

  • Наблюдение за реальными коммитами (по ссылке на SemiAnalysis, около 4% коммитов на GitHub уже делает Claude Code)

  • Опросы

  • Фиксированные задачи вместо собственных

  • Бенчмарки агентов

  • Рандомизация по людям, а не по задачам

У некоторых из них сразу оговорены недостатки.

Вывод для тех, кто читает новости, простой: если вы видите «ИИ ускорил нашу команду в N раз», спросите, откуда взялась эта цифра. Если из опроса, то вспомните, что в единственном известном мне сравнении субъективных оценок с секундомером люди ошиблись в знаке. Если из эксперимента — уточните, сколько платили участникам и кто отказался участвовать.

Если вы знаете свежий RCT на агентах 2026 г., где с этим всё в порядке, — поделитесь в комментариях, я такого пока не нашёл.

Источники

Автор: Igoryas

Источник

Оставить комментарий