← Усі пости

Есе · серпень 2026 р.

Автономний AI-агент: 14 годин замість 2–17 тижнів роботи

Epoch AI разом із METR опублікували MirrorCode — бенчмарк, у якому AI переписує програму цілком, маючи лише доступ до її командного рядка. Claude Opus 4.7 переписав утиліту gotree на ~16 000 рядків за 14 годин і $251; інженеру без AI на це відвели від 2 до 17 тижнів. Але 8 із 25 програм жоден прогін не довів до 100%. Різницю визначає не розмір моделі, а те, чи можна перевірити результат машинно: у MirrorCode готовність задає точний збіг виводу на прихованих тестах.

Claude Opus 4.7 переписав з нуля програму на шістнадцять тисяч рядків за 14 годин, витративши $251 на інференс. Тим самим інженерам-людям без AI Epoch AI і METR відвели на цю роботу від двох до сімнадцяти тижнів.

Цифру вже рознесли як доказ того, що агенти дозріли до справжньої роботи. У самому бенчмарку є деталь важливіша за рекорд: умова, за якої рекорд узагалі став можливий. Саме від неї залежить, чи спрацює автоматизація у вашій компанії; розмір моделі тут другорядний.

Що таке MirrorCode і чому це не черговий бенчмарк про код

MirrorCode розробили Epoch AI і METR, щоб перевірити AI на довгих задачах, а не на латанні окремих багів. Постановка жорстка: моделі дають працюючу програму, але тільки через командний рядок. Вихідного коду немає, інтернету немає, підглянути ніде. Треба самостійно зрозуміти, що ця програма робить, і написати власну реалізацію, яка поводитиметься так само.

Перевіряють результат наскрізними тестами, яких агент ніколи не бачив, і вивід має збігтися точно. Підмінити роботу таблицею готових відповідей неможливо, саме тому тести й тримають прихованими.

Двадцять п'ять цільових програм охоплюють різні куточки computer science: unix-утиліти, серіалізацію та запити до даних, біоінформатику, інтерпретатори, статичний аналіз, криптографію, стиснення. Для масштабу — три приклади з набору:

Програма

Що робить

Обсяг

pkl

мова програмованої конфігурації, розробка Apple

61 000 рядків

qsv_select

вибір і перевпорядкування колонок CSV

87 000 рядків

gotree

робота з філогенетичними деревами, 40+ команд

16 000 рядків

Головна відмінність від звичних бенчмарків — гроші. Більшість тестів обмежують витрати на один прогін сумою в $1–10, навіть коли задача людині коштувала б тижнів. Тут бюджет дали такий, щоб спроба була серйозною. У лідерборді кожна спроба отримує до 10 мільярдів токенів і до 7 діб; прогони зі статті йшли за іншим правилом — обмеження було за токенами, а стеля за часом не ставилася взагалі. Саме звідти цифра в 19 діб безперервної роботи, яку ви побачите нижче.

Цифри, які варто тримати перед очима

Нижче — те, що Epoch AI опублікувала як результат, разом з тим, що зазвичай губиться в переказах: скільки цілей моделі не взяли.

Що виміряли

Результат

gotree, Claude Opus 4.7

14 годин, $251

Оцінка тієї ж роботи для інженера без AI

2–17 тижнів

gotree різними мовами, Opus 4.7 і GPT-5.5

$100–400 за прогін

Найбільша задача набору (прогін зі статті, без ліміту часу)

$2 600, 19 діб роботи без втручання людини

Цілі, де був хоча б один бездоганний прогін

17 із 25

Цілі, не взяті на 100% жодного разу

8 із 25

З цих восьми: дійшли до 99%, але не до 100%

4

З цих восьми: не дотягнули й до 99%

4

Провідні моделі роком раніше

близько 30% за метрикою бенчмарку, і лише прості програми на кшталт календаря

За рік межа зсунулася з календарної утиліти до мови конфігурації від Apple, і цей темп означає, що будь-яке рішення «AI такого не вміє» має термін придатності близько року.

Де AI провалився

Вісім програм із двадцяти п'яти не піддалися на сто відсотків жодного разу, чотири — навіть на дев'яносто дев'ять. Найгірше моделям дався ruff, лінтер і форматувальник коду Python. У тому ж списку опинилися giac_subset, математичний пакет, і mailauth, бібліотека автентифікації електронної пошти.

Автори бенчмарку констатують факт провалу, але не пояснюють його причину, тож наступний абзац — наша інтерпретація, а не висновок Epoch AI.

Провалився при цьому не найбільший проєкт: гігантський qsv_select моделі брали, а лінтер ні. Лінтер є втіленням домовленостей: сотні дрібних рішень про те, який запис вважати правильним, ухвалених за роки й зафіксованих у поведінці, а не в описі. Спитайте двох Python-розробників, скільки порожніх рядків має стояти перед вкладеною функцією, і почуєте суперечку, якої немає в жодній специфікації. Відтворити таку систему з поведінки складніше, ніж велику, але послідовну. Те саме стосується криптографічно чутливої логіки в mailauth, де «майже правильно» дорівнює «неправильно».

Та сама межа проходить і в бізнесі: обсяг роботи AI витягує, а неписані домовленості компанії про те, що вважати правильним, — ні.

Умова, за якої довга автономія взагалі можлива

У MirrorCode є те, чого немає майже в жодному бізнес-процесі: безсуперечне машинне визначення готовності. «Готово» тут означає, що вивід збігся з еталонним на тестах, яких агент не бачив. Не «схоже», не «в цілому ок» і не «керівник глянув і кивнув».

Саме тому агент витримує 14 годин, а на найбільшій задачі зі статті — 19 діб поспіль без людини. Модель усередині прогону помиляється скільки завгодно разів, і кожна помилка коштує токенів: її ловить машина, ловить миттєво і безкоштовно.

Довжина автономної роботи агента дорівнює не силі моделі, а тому, наскільки дешево перевірити результат. Немає дешевої перевірки — немає довгої автономії, хоч яку модель ви поставите.

Ту саму залежність з іншого боку ми розбирали в матеріалі про те, чому в різних компаній однаковий агент дає різний результат.

Тут доречна й чесна засторога від самих авторів. Цільові програми — це реальний відкритий код, тож моделі майже напевно бачили їх під час навчання. Epoch AI прогнала перевірку на запам'ятовування і зазначає, що AI успішно переписав кілька програм, які цю перевірку пройшли, а на частині програм із ознаками запам'ятовування — навпаки, провалився. Тобто результат не зводиться до зубріння, але повністю виключити його внесок автори не беруться. Приймайте цифри як верхню оцінку, а не як гарантію.

Тест на вартість перевірки: перенос на SMB

Перш ніж питати «чи потягне агент цей процес», поставте три питання про сам процес.

  1. Чи існує еталон? Чи можна одним реченням описати правильно виконану роботу так, щоб двоє ваших співробітників зрозуміли опис однаково.
  2. Скільки коштує одна перевірка? Хвилина роботи junior-співробітника чи година часу керівника. Це визначає, скільки спроб ви взагалі можете собі дозволити.
  3. Що коштує пропущена помилка? Виправлений запис у базі — це одне; надіслана клієнту сума — зовсім інше.

Розкладіть свої процеси за цією логікою, і картина зазвичай виходить така:

Перевірка дешева й машинна

Перевірка дорога або суб'єктивна

нормалізація товарного каталогу за заданою схемою

вибір позиціювання для нової послуги

пошук і зведення дублів клієнтів

переговорна тактика в складній угоді

розшифровка дзвінка у структуровані поля CRM

рішення, кому з двох постачальників віддати контракт

звірка вивантаження з первинними документами

формулювання комерційної пропозиції під конкретного клієнта

перевірка заявки на повноту даних

оцінка, чи варто утримувати клієнта, що йде

Процеси з лівої колонки можна віддавати агенту вже зараз і рахувати ROI чесно. Права — не «AI сюди не зайде ніколи», а «тут агент працює під людиною, короткими кроками, і економія рахується інакше». Межу між вбудованим AI у процесі й повноцінною автономією ми розкладали окремо — коли автономність зайва.

Найчастіша помилка на цьому кроці — почати з процесу, який болить найбільше. Починати треба з процесу, який найдешевше перевірити: він дасть вам робочий вимір ефекту, а вже з ним можна йти до дорогих.

$251 — це багато чи мало

Порівняння $251 із двома-сімнадцятьма тижнями інженерної роботи виглядає нищівним, і саме в такому вигляді його зазвичай цитують. Варто додати три поправки.

Це вартість одного успішного прогону. У лідерборді кожну задачу проганяють тричі, і невдалі спроби так само спалюють бюджет, тож реальна вартість результату включає їх. Далі, це лабораторія: задача сформульована, середовище зібране, критерій готовності написаний до старту. У компанії саме ця підготовка і є найдорожчим рядком, а не інференс. І нарешті, $2 600 за найбільшу задачу нагадують, що довга автономія має ціну, яка росте разом з амбіцією.

Повний розклад того, з чого складається вартість агента поза лабораторією, лежить у розборі скільки насправді коштує AI-агент, а методика підрахунку віддачі — в матеріалі як рахувати ROI AI-агентів.

Що зробити цього тижня

  1. Виберіть один процес, який повторюється щотижня і зараз виконується руками.
  2. Напишіть критерій готовності одним реченням, у формі перевірки: «результат правильний, якщо збігається з X». Не вийшло сформулювати — це і є ваша перша задача, і вона не про AI.
  3. Порахуйте вартість однієї перевірки в хвилинах і в тому, чий це час.
  4. Оцініть ціну пропущеної помилки. Якщо вона висока, залишайте людину на виході й на першому етапі скорочуйте не контроль, а підготовку.
  5. Виміряйте одну метрику до і після: години на процес або кількість помилок на сотню операцій.

Якщо через два тижні метрика не зрушила, справа майже завжди в другому кроці. Ширший зріз того, що зараз реально працює в малому бізнесі, дає розбір стану AI-агентів для SMB у 2026 році, а базове введення в тему — AI-агенти для малого бізнесу.


Джерела

Наступний крок. Пройдіть безкоштовний AI-аудит за дві хвилини: він показує, у яких ваших процесах результат перевіряється дешево, а де спершу треба навести лад у даних. Склад наших front-office агентів — на окремій сторінці.

Якщо у вашому оточенні хтось саме зараз обирає перший процес під автоматизацію, перешліть йому таблицю з двома колонками вище: вона економить місяць спроб не з того боку.

Опубліковано Andrew Maryasov, засновником Grow2.ai — AI-агенти та AI-консалтинг для малого й середнього бізнесу. Grow2.ai — AI-підрозділ Auspex.

Часті запитання

Що таке MirrorCode простими словами?

Це бенчмарк Epoch AI і METR, у якому AI отримує доступ до працюючої програми тільки через командний рядок і має написати власну програму, що поводиться так само. Вихідний код і інтернет недоступні, а результат перевіряють наскрізними тестами, яких модель ніколи не бачила. Набір складається з 25 цільових програм у шести мовах програмування.

Чи означає це, що AI замінить розробників?

Ні, і сам бенчмарк це показує: 8 із 25 програм не переписані на 100% жодного разу. AI впорався з задачами, де правильність результату перевіряє машина за точним збігом виводу. Робота розробника здебільшого складається з іншого — зрозуміти, що саме треба побудувати, і домовитися про критерії, а цієї частини в MirrorCode немає за постановкою.

Чому 8 із 25 програм не піддалися?

Epoch AI називає найважчі цілі — ruff, лінтер і форматувальник Python, математичний пакет giac_subset і бібліотеку поштової автентифікації mailauth — але причини не пояснює. За оцінкою Grow2.ai, справа не в обсязі: значно більші програми моделі брали. Складність створюють неявні домовленості про те, що вважати правильним виводом, які ніде не записані повністю.

Чи можна довірити AI-агенту тижневу задачу в моїй компанії?

Це залежить не від моделі, а від того, чи можна перевірити результат машинно й дешево. Якщо для процесу існує еталон, з яким вивід звіряється автоматично, довга автономна робота реалістична. Якщо готовність визначає думка керівника, агента варто ставити на короткі кроки з перевіркою людиною на виході.

Скільки коштує довга автономна робота AI?

У MirrorCode одна успішна реалізація gotree коштувала $251, прогони тієї ж задачі різними мовами коштували від $100 до $400, а найбільша задача набору — $2 600 за 19 діб безперервної роботи (прогін зі статті, де стелі за часом не було). Це вартість інференсу в лабораторних умовах, без урахування невдалих спроб і без підготовки задачі. У реальному проєкті основна стаття витрат — приведення даних і процесу до придатного стану, а не токени.

Що таке контамінація даних і чи псує вона ці результати?

Цільові програми MirrorCode — це реальний відкритий код, тому моделі майже напевно бачили їх під час навчання, і це може завищувати оцінку. Epoch AI прогнала перевірку на запам'ятовування: AI успішно переписав кілька програм, які цю перевірку пройшли, і провалився на частині тих, де ознаки запам'ятовування знайшлися. Автори роблять висновок, що результат не зводиться до зубріння, але внесок запам'ятовування повністю не виключають.

З чого почати SMB після цієї новини?

Не з вибору моделі, а з інвентаризації процесів за вартістю перевірки результату. Візьміть тижневий повторюваний процес, сформулюйте критерій готовності у вигляді машинної перевірки і виміряйте одну метрику до впровадження. Grow2.ai запускає пілоти від €1 800 з контрактним KPI на 14 днів: не спрацював — не платите.

AI-агенти для бізнесу — 2–3 листи на місяць

Розбори, кейси та інструменти, які вже працюють у компаніях.

Без спаму. Відписатися можна в один клік.