В прогоне бенчмарка MirrorCode летом 2026 года флагманская на тот момент модель Claude (Opus 4.7) переписала с нуля программу на шестнадцать тысяч строк за 14 часов, потратив $251 на инференс. Тем же инженерам-людям без AI Epoch AI и METR отвели на эту работу от двух до семнадцати недель.
Цифру уже разнесли как доказательство того, что агенты дозрели до настоящей работы. В самом бенчмарке есть деталь важнее рекорда: условие, при котором рекорд вообще стал возможен. Именно от него зависит, сработает ли автоматизация в вашей компании; размер модели здесь второстепенен.
Что такое MirrorCode и почему это не очередной бенчмарк про код
MirrorCode разработали Epoch AI и METR, чтобы проверить AI на длинных задачах, а не на латании отдельных багов. Постановка жёсткая: модели дают работающую программу, но только через командную строку. Исходного кода нет, интернета нет, подсмотреть негде. Надо самостоятельно понять, что эта программа делает, и написать собственную реализацию, которая будет вести себя так же.
Результат проверяют сквозными тестами, которых агент никогда не видел, и вывод должен совпасть точно. Подменить работу таблицей готовых ответов невозможно, именно поэтому тесты и держат скрытыми.
Двадцать пять целевых программ охватывают разные уголки computer science: unix-утилиты, сериализацию и запросы к данным, биоинформатику, интерпретаторы, статический анализ, криптографию, сжатие. Для масштаба — три примера из набора:
Программа | Что делает | Объём |
|---|---|---|
pkl | язык программируемой конфигурации, разработка Apple | 61 000 строк |
qsv_select | выбор и переупорядочивание колонок CSV | 87 000 строк |
gotree | работа с филогенетическими деревьями, 40+ команд | 16 000 строк |
Главное отличие от привычных бенчмарков — деньги. Большинство тестов ограничивают расходы на один прогон суммой в $1–10, даже когда задача человеку стоила бы недель. Здесь бюджет дали такой, чтобы попытка была серьёзной. В лидерборде каждая попытка получает до 10 миллиардов токенов и до 7 суток; прогоны из статьи шли по другому правилу — ограничение было по токенам, а потолок по времени не ставился вообще. Именно оттуда цифра в 19 суток непрерывной работы, которую вы увидите ниже.
Цифры, которые стоит держать перед глазами
Ниже — то, что Epoch AI опубликовала как результат, вместе с тем, что обычно теряется в пересказах: сколько целей модели не взяли.
Что измеряли в бенчмарке MirrorCode | Результат |
|---|---|
gotree, Claude Opus 4.7 | 14 часов, $251 |
Оценка той же работы для инженера без AI | 2–17 недель |
gotree на разных языках, тот же бенчмарк, Opus 4.7 и GPT-5.5 | $100–400 за прогон |
Самая большая задача набора (прогон из статьи, без лимита времени) | $2 600, 19 суток работы без вмешательства человека |
Цели, где был хотя бы один безупречный прогон | 17 из 25 |
Цели, не взятые на 100% ни разу | 8 из 25 |
Из этих восьми: дошли до 99%, но не до 100% | 4 |
Из этих восьми: не дотянули и до 99% | 4 |
Ведущие модели годом раньше | около 30% по метрике бенчмарка, и только простые программы вроде календаря |
За год граница сдвинулась с календарной утилиты до языка конфигурации от Apple, и этот темп означает, что любое решение «AI такого не умеет» имеет срок годности около года.
Где AI провалился
Восемь программ из двадцати пяти не поддались на сто процентов ни разу, четыре — даже на девяносто девять. Хуже всего моделям дался ruff, линтер и форматировщик кода Python. В том же списке оказались giac_subset, математический пакет, и mailauth, библиотека аутентификации электронной почты.
Авторы бенчмарка констатируют факт провала, но не объясняют его причину, так что следующий абзац — наша интерпретация, а не вывод Epoch AI.
Провалился при этом не самый большой проект: гигантский qsv_select модели брали, а линтер нет. Линтер есть воплощение договорённостей: сотни мелких решений о том, какую запись считать правильной, принятых за годы и зафиксированных в поведении, а не в описании. Спросите двух Python-разработчиков, сколько пустых строк должно стоять перед вложенной функцией, и услышите спор, которого нет ни в одной спецификации. Воспроизвести такую систему из поведения сложнее, чем большую, но последовательную. То же касается криптографически чувствительной логики в mailauth, где «почти правильно» равно «неправильно».
Та же граница проходит и в бизнесе: объём работы AI вытягивает, а неписаные договорённости компании о том, что считать правильным, — нет.
Условие, при котором долгая автономия вообще возможна
В MirrorCode есть то, чего нет почти ни в одном бизнес-процессе: бесспорное машинное определение готовности. «Готово» здесь означает, что вывод совпал с эталонным на тестах, которых агент не видел. Не «похоже», не «в целом ок» и не «руководитель глянул и кивнул».
Именно поэтому агент выдерживает 14 часов, а на самой большой задаче из статьи — 19 суток подряд без человека. Модель внутри прогона ошибается сколько угодно раз, и каждая ошибка стоит токенов: её ловит машина, ловит мгновенно и бесплатно.
Длительность автономной работы агента равна не силе модели, а тому, насколько дёшево проверить результат. Нет дешёвой проверки — нет долгой автономии, какую модель ни поставь.
Ту же зависимость с другой стороны мы разбирали в материале о том, почему у разных компаний одинаковый агент даёт разный результат.
Здесь уместна и честная оговорка от самих авторов. Целевые программы — это реальный открытый код, так что модели почти наверняка видели их во время обучения. Epoch AI прогнала проверку на запоминание и отмечает, что AI успешно переписал несколько программ, которые эту проверку прошли, а на части программ с признаками запоминания — наоборот, провалился. То есть результат не сводится к зубрёжке, но полностью исключить его вклад авторы не берутся. Принимайте цифры как верхнюю оценку, а не как гарантию.
Тест на стоимость проверки: перенос на SMB
Прежде чем спрашивать «потянет ли агент этот процесс», задайте три вопроса о самом процессе.
- Существует ли эталон? Можно ли одним предложением описать правильно выполненную работу так, чтобы двое ваших сотрудников поняли описание одинаково.
- Сколько стоит одна проверка? Минута работы junior-сотрудника или час времени руководителя. Это определяет, сколько попыток вы вообще можете себе позволить.
- Что стоит пропущенная ошибка? Исправленная запись в базе — это одно; отправленная клиенту сумма — совсем другое.
Разложите свои процессы по этой логике, и картина обычно получается такая:
Проверка дешёвая и машинная | Проверка дорогая или субъективная |
|---|---|
нормализация товарного каталога по заданной схеме | выбор позиционирования для новой услуги |
поиск и сведение дублей клиентов | переговорная тактика в сложной сделке |
расшифровка звонка в структурированные поля CRM | решение, кому из двух поставщиков отдать контракт |
сверка выгрузки с первичными документами | формулировка коммерческого предложения под конкретного клиента |
проверка заявки на полноту данных | оценка, стоит ли удерживать уходящего клиента |
Процессы из левой колонки можно отдавать агенту уже сейчас и считать ROI по фактам. Правая — не «AI сюда не зайдёт никогда», а «здесь агент работает под человеком, короткими шагами, и экономия считается иначе». Границу между встроенным AI в процессе и полноценной автономией мы раскладывали отдельно — когда автономность лишняя.
Самая частая ошибка на этом шаге — начать с процесса, который болит сильнее всего. Начинать надо с процесса, который дешевле всего проверить: он даст вам рабочее измерение эффекта, а уже с ним можно идти к дорогим.
$251 — это много или мало
Сравнение $251 с двумя-семнадцатью неделями инженерной работы выглядит сокрушительным, и именно в таком виде его обычно цитируют. Стоит добавить три поправки.
Это стоимость одного успешного прогона. В лидерборде каждую задачу прогоняют трижды, и неудачные попытки так же сжигают бюджет, так что реальная стоимость результата включает их. Дальше, это лаборатория: задача сформулирована, среда собрана, критерий готовности написан до старта. В компании именно эта подготовка и есть самая дорогая строка, а не инференс. И наконец, $2 600 за самую большую задачу напоминают, что долгая автономия имеет цену, которая растёт вместе с амбицией.
Полная раскладка того, из чего складывается стоимость агента вне лаборатории, лежит в разборе сколько на самом деле стоит AI-агент, а методика подсчёта отдачи — в материале как считать ROI AI-агентов.
Что сделать на этой неделе
- Выберите один процесс, который повторяется еженедельно и сейчас выполняется руками.
- Напишите критерий готовности одним предложением, в форме проверки: «результат правильный, если совпадает с X». Не получилось сформулировать — это и есть ваша первая задача, и она не про AI.
- Посчитайте стоимость одной проверки в минутах и в том, чьё это время.
- Оцените цену пропущенной ошибки. Если она высокая, оставляйте человека на выходе и на первом этапе сокращайте подготовку, не контроль.
- Измерьте одну метрику до и после: часы на процесс или количество ошибок на сотню операций.
Если через две недели метрика не сдвинулась, дело почти всегда во втором шаге. Более широкий срез того, что сейчас реально работает в малом бизнесе, даёт разбор состояния AI-агентов для SMB в 2026 году, а базовое введение в тему — AI-агенты для малого бизнеса.
Источники
- Epoch AI × METR, MirrorCode: What's the largest software project AI can complete on its own? — страница бенчмарка с результатами и оговорками авторов.
- Tom Adamczewski, David Owen, David Rein и др., MirrorCode: AI can rebuild entire programs from behavior alone, arXiv 2606.30182, 2026 — полная статья.
- Jack Clark, Import AI 466, 27 июля 2026 — разбор результатов и тезис о способности систем самостоятельно ориентироваться в незнакомой среде.
- Исходный код и 22 из 25 целевых программ (Epoch Research, GitHub).
Следующий шаг. Пройдите бесплатный AI-аудит за две минуты: он показывает, в каких ваших процессах результат проверяется дёшево, а где сначала надо навести порядок в данных. Состав наших front-office агентов — на отдельной странице.
Если в вашем окружении кто-то прямо сейчас выбирает первый процесс под автоматизацию, перешлите ему таблицу с двумя колонками выше: она экономит месяц попыток не с той стороны.
Опубликовано Andrew Maryasov, основателем Grow2.ai — AI-агенты и AI-консалтинг для малого и среднего бизнеса. Grow2.ai — AI-подразделение Auspex.
