← Все посты

Эссе · Автор: Andrew Maryasov, основатель Grow2.ai ·

Автономный AI-агент: 14 часов вместо 2–17 недель работы

Инфографика: Автономный AI-агент: 14 часов вместо 2–17 недель работы

В прогоне бенчмарка MirrorCode летом 2026 года флагманская на тот момент модель Claude (Opus 4.7) переписала с нуля программу на шестнадцать тысяч строк за 14 часов, потратив $251 на инференс. Тем же инженерам-людям без AI Epoch AI и METR отвели на эту работу от двух до семнадцати недель.

Цифру уже разнесли как доказательство того, что агенты дозрели до настоящей работы. В самом бенчмарке есть деталь важнее рекорда: условие, при котором рекорд вообще стал возможен. Именно от него зависит, сработает ли автоматизация в вашей компании; размер модели здесь второстепенен.

Что такое MirrorCode и почему это не очередной бенчмарк про код

MirrorCode разработали Epoch AI и METR, чтобы проверить AI на длинных задачах, а не на латании отдельных багов. Постановка жёсткая: модели дают работающую программу, но только через командную строку. Исходного кода нет, интернета нет, подсмотреть негде. Надо самостоятельно понять, что эта программа делает, и написать собственную реализацию, которая будет вести себя так же.

Результат проверяют сквозными тестами, которых агент никогда не видел, и вывод должен совпасть точно. Подменить работу таблицей готовых ответов невозможно, именно поэтому тесты и держат скрытыми.

Двадцать пять целевых программ охватывают разные уголки computer science: unix-утилиты, сериализацию и запросы к данным, биоинформатику, интерпретаторы, статический анализ, криптографию, сжатие. Для масштаба — три примера из набора:

Программа

Что делает

Объём

pkl

язык программируемой конфигурации, разработка Apple

61 000 строк

qsv_select

выбор и переупорядочивание колонок CSV

87 000 строк

gotree

работа с филогенетическими деревьями, 40+ команд

16 000 строк

Главное отличие от привычных бенчмарков — деньги. Большинство тестов ограничивают расходы на один прогон суммой в $1–10, даже когда задача человеку стоила бы недель. Здесь бюджет дали такой, чтобы попытка была серьёзной. В лидерборде каждая попытка получает до 10 миллиардов токенов и до 7 суток; прогоны из статьи шли по другому правилу — ограничение было по токенам, а потолок по времени не ставился вообще. Именно оттуда цифра в 19 суток непрерывной работы, которую вы увидите ниже.

Цифры, которые стоит держать перед глазами

Ниже — то, что Epoch AI опубликовала как результат, вместе с тем, что обычно теряется в пересказах: сколько целей модели не взяли.

Что измеряли в бенчмарке MirrorCode

Результат

gotree, Claude Opus 4.7

14 часов, $251

Оценка той же работы для инженера без AI

2–17 недель

gotree на разных языках, тот же бенчмарк, Opus 4.7 и GPT-5.5

$100–400 за прогон

Самая большая задача набора (прогон из статьи, без лимита времени)

$2 600, 19 суток работы без вмешательства человека

Цели, где был хотя бы один безупречный прогон

17 из 25

Цели, не взятые на 100% ни разу

8 из 25

Из этих восьми: дошли до 99%, но не до 100%

4

Из этих восьми: не дотянули и до 99%

4

Ведущие модели годом раньше

около 30% по метрике бенчмарка, и только простые программы вроде календаря

За год граница сдвинулась с календарной утилиты до языка конфигурации от Apple, и этот темп означает, что любое решение «AI такого не умеет» имеет срок годности около года.

Где AI провалился

Восемь программ из двадцати пяти не поддались на сто процентов ни разу, четыре — даже на девяносто девять. Хуже всего моделям дался ruff, линтер и форматировщик кода Python. В том же списке оказались giac_subset, математический пакет, и mailauth, библиотека аутентификации электронной почты.

Авторы бенчмарка констатируют факт провала, но не объясняют его причину, так что следующий абзац — наша интерпретация, а не вывод Epoch AI.

Провалился при этом не самый большой проект: гигантский qsv_select модели брали, а линтер нет. Линтер есть воплощение договорённостей: сотни мелких решений о том, какую запись считать правильной, принятых за годы и зафиксированных в поведении, а не в описании. Спросите двух Python-разработчиков, сколько пустых строк должно стоять перед вложенной функцией, и услышите спор, которого нет ни в одной спецификации. Воспроизвести такую систему из поведения сложнее, чем большую, но последовательную. То же касается криптографически чувствительной логики в mailauth, где «почти правильно» равно «неправильно».

Та же граница проходит и в бизнесе: объём работы AI вытягивает, а неписаные договорённости компании о том, что считать правильным, — нет.

Условие, при котором долгая автономия вообще возможна

В MirrorCode есть то, чего нет почти ни в одном бизнес-процессе: бесспорное машинное определение готовности. «Готово» здесь означает, что вывод совпал с эталонным на тестах, которых агент не видел. Не «похоже», не «в целом ок» и не «руководитель глянул и кивнул».

Именно поэтому агент выдерживает 14 часов, а на самой большой задаче из статьи — 19 суток подряд без человека. Модель внутри прогона ошибается сколько угодно раз, и каждая ошибка стоит токенов: её ловит машина, ловит мгновенно и бесплатно.

Длительность автономной работы агента равна не силе модели, а тому, насколько дёшево проверить результат. Нет дешёвой проверки — нет долгой автономии, какую модель ни поставь.

Ту же зависимость с другой стороны мы разбирали в материале о том, почему у разных компаний одинаковый агент даёт разный результат.

Здесь уместна и честная оговорка от самих авторов. Целевые программы — это реальный открытый код, так что модели почти наверняка видели их во время обучения. Epoch AI прогнала проверку на запоминание и отмечает, что AI успешно переписал несколько программ, которые эту проверку прошли, а на части программ с признаками запоминания — наоборот, провалился. То есть результат не сводится к зубрёжке, но полностью исключить его вклад авторы не берутся. Принимайте цифры как верхнюю оценку, а не как гарантию.

Тест на стоимость проверки: перенос на SMB

Прежде чем спрашивать «потянет ли агент этот процесс», задайте три вопроса о самом процессе.

  1. Существует ли эталон? Можно ли одним предложением описать правильно выполненную работу так, чтобы двое ваших сотрудников поняли описание одинаково.
  2. Сколько стоит одна проверка? Минута работы junior-сотрудника или час времени руководителя. Это определяет, сколько попыток вы вообще можете себе позволить.
  3. Что стоит пропущенная ошибка? Исправленная запись в базе — это одно; отправленная клиенту сумма — совсем другое.

Разложите свои процессы по этой логике, и картина обычно получается такая:

Проверка дешёвая и машинная

Проверка дорогая или субъективная

нормализация товарного каталога по заданной схеме

выбор позиционирования для новой услуги

поиск и сведение дублей клиентов

переговорная тактика в сложной сделке

расшифровка звонка в структурированные поля CRM

решение, кому из двух поставщиков отдать контракт

сверка выгрузки с первичными документами

формулировка коммерческого предложения под конкретного клиента

проверка заявки на полноту данных

оценка, стоит ли удерживать уходящего клиента

Процессы из левой колонки можно отдавать агенту уже сейчас и считать ROI по фактам. Правая — не «AI сюда не зайдёт никогда», а «здесь агент работает под человеком, короткими шагами, и экономия считается иначе». Границу между встроенным AI в процессе и полноценной автономией мы раскладывали отдельно — когда автономность лишняя.

Самая частая ошибка на этом шаге — начать с процесса, который болит сильнее всего. Начинать надо с процесса, который дешевле всего проверить: он даст вам рабочее измерение эффекта, а уже с ним можно идти к дорогим.

$251 — это много или мало

Сравнение $251 с двумя-семнадцатью неделями инженерной работы выглядит сокрушительным, и именно в таком виде его обычно цитируют. Стоит добавить три поправки.

Это стоимость одного успешного прогона. В лидерборде каждую задачу прогоняют трижды, и неудачные попытки так же сжигают бюджет, так что реальная стоимость результата включает их. Дальше, это лаборатория: задача сформулирована, среда собрана, критерий готовности написан до старта. В компании именно эта подготовка и есть самая дорогая строка, а не инференс. И наконец, $2 600 за самую большую задачу напоминают, что долгая автономия имеет цену, которая растёт вместе с амбицией.

Полная раскладка того, из чего складывается стоимость агента вне лаборатории, лежит в разборе сколько на самом деле стоит AI-агент, а методика подсчёта отдачи — в материале как считать ROI AI-агентов.

Что сделать на этой неделе

  1. Выберите один процесс, который повторяется еженедельно и сейчас выполняется руками.
  2. Напишите критерий готовности одним предложением, в форме проверки: «результат правильный, если совпадает с X». Не получилось сформулировать — это и есть ваша первая задача, и она не про AI.
  3. Посчитайте стоимость одной проверки в минутах и в том, чьё это время.
  4. Оцените цену пропущенной ошибки. Если она высокая, оставляйте человека на выходе и на первом этапе сокращайте подготовку, не контроль.
  5. Измерьте одну метрику до и после: часы на процесс или количество ошибок на сотню операций.

Если через две недели метрика не сдвинулась, дело почти всегда во втором шаге. Более широкий срез того, что сейчас реально работает в малом бизнесе, даёт разбор состояния AI-агентов для SMB в 2026 году, а базовое введение в тему — AI-агенты для малого бизнеса.


Источники

Следующий шаг. Пройдите бесплатный AI-аудит за две минуты: он показывает, в каких ваших процессах результат проверяется дёшево, а где сначала надо навести порядок в данных. Состав наших front-office агентов — на отдельной странице.

Если в вашем окружении кто-то прямо сейчас выбирает первый процесс под автоматизацию, перешлите ему таблицу с двумя колонками выше: она экономит месяц попыток не с той стороны.

Опубликовано Andrew Maryasov, основателем Grow2.ai — AI-агенты и AI-консалтинг для малого и среднего бизнеса. Grow2.ai — AI-подразделение Auspex.

Частые вопросы

Что такое MirrorCode простыми словами?

Это бенчмарк Epoch AI и METR, в котором AI получает доступ к работающей программе только через командную строку и должен написать собственную программу, которая ведёт себя так же. Исходный код и интернет недоступны, а результат проверяют сквозными тестами, которых модель никогда не видела. Набор состоит из 25 целевых программ на шести языках программирования.

Значит ли это, что AI заменит разработчиков?

Нет, и сам бенчмарк это показывает: 8 из 25 программ не переписаны на 100% ни разу. AI справился с задачами, где правильность результата проверяет машина по точному совпадению вывода. Работа разработчика по большей части состоит из другого — понять, что именно надо построить, и договориться о критериях, а этой части в MirrorCode нет по постановке.

Почему 8 из 25 программ не поддались?

Epoch AI называет самые тяжёлые цели — ruff, линтер и форматировщик Python, математический пакет giac_subset и библиотеку почтовой аутентификации mailauth, — но причины не объясняет. По оценке Grow2.ai, дело не в объёме: значительно большие программы модели брали. Сложность создают неявные договорённости о том, что считать правильным выводом, которые нигде не записаны полностью.

Можно ли доверить AI-агенту недельную задачу в моей компании?

Это зависит не от модели, а от того, можно ли проверить результат машинно и дёшево. Если для процесса существует эталон, с которым вывод сверяется автоматически, долгая автономная работа реалистична. Если готовность определяет мнение руководителя, агента стоит ставить на короткие шаги с проверкой человеком на выходе.

Сколько стоит долгая автономная работа AI?

В MirrorCode одна успешная реализация gotree стоила $251, прогоны той же задачи на разных языках стоили от $100 до $400, а самая большая задача набора — $2 600 за 19 суток непрерывной работы (прогон из статьи, где потолка по времени не было). Это стоимость инференса в лабораторных условиях, без учёта неудачных попыток и без подготовки задачи. В реальном проекте основная статья расходов — приведение данных и процесса в пригодное состояние, а не токены.

Что такое контаминация данных и портит ли она эти результаты?

Целевые программы MirrorCode — это реальный открытый код, поэтому модели почти наверняка видели их во время обучения, и это может завышать оценку. Epoch AI прогнала проверку на запоминание: AI успешно переписал несколько программ, которые эту проверку прошли, и провалился на части тех, где признаки запоминания нашлись. Авторы делают вывод, что результат не сводится к зубрёжке, но вклад запоминания полностью не исключают.

С чего начать SMB после этой новости?

Не с выбора модели, а с инвентаризации процессов по стоимости проверки результата. Возьмите недельный повторяющийся процесс, сформулируйте критерий готовности в виде машинной проверки и измерьте одну метрику до внедрения. Grow2.ai запускает пилоты от €1 800 (Starter, 14 дней) с контрактным KPI. Пилот оплачивается вперёд; если на ревью 30-го дня согласованная KPI не сдвинулась — возвращаем полную сумму.

AI-агенты для бизнеса — 2–3 письма в месяц

Разборы, кейсы и инструменты, которые уже работают в компаниях.

Без спама. Отписаться можно в один клик.