Если бы автоматический градер был гурманом, он бы поставил зелёную метку — и уверовал, что суп готов. Ха! А мейнтейнер‑шеф попробовал ложку и сказал: «Соли маловато, и кастрюля дымит». Такова краткая суть исследования METR.

Коротко — что сделали? Взяли 296 AI‑сгенерированных PR, которые прошли SWE‑bench автоматические тесты, и попросили четырёх реальных мейнтейнеров из scikit‑learn, Sphinx и pytest решить: вмерджить или попросить правки. Для проверки шума переслали им и 47 человеческих “золотых” PR (baseline — 68% мерджей).

Результат? Примерно половина PR, «прошедших» автоматический градер, не прошли бы ревью мейнтейнеров. В среднем разница — около 24 процентных пункта в пользу автоматического града. И да, скорость улучшения по годам у решений мейнтейнеров кажется медленнее — на ~9.6 pp/yr, но этот тренд не так устойчив.

Почему так? Причины — живые и понятные: код‑стиль и соответствие репо‑стандартам, неожиданные регрессии в другой части проекта, или просто патч не решает основную проблему. Представьте аптекаря, который по чек‑листу проверил упаковку, а врач сказал: “лекарство не то”. Примеры из ревью — в тексте исследования: от «слишком громоздко» до «ломает тесты в других модулях».

Что это значит для практики? Бенчмарки дают сигнал, но не заменяют человеческий контроль и итерацию. Агент получил одно-shot‑попытку; человек обычно правит, обсуждает, допиливает. Поэтому оценивать полезность алгоритма только по автоматическим тестам — рискованно.

Вывод простой: автоматические галочки — хороши, но настоящий фильтр — живой мейнтейнер. Хотите реальной пользы от агентов? Учите их итеративному диалогу с ревьюером и не верьте числам без контекста.

Источник: METR — Many SWE‑bench‑Passing PRs Would Not Be Merged into Main (2026).