Claude Opus 4.7 переписав з нуля програму на шістнадцять тисяч рядків за 14 годин, витративши $251 на інференс. Тим самим інженерам-людям без AI Epoch AI і METR відвели на цю роботу від двох до сімнадцяти тижнів.
Цифру вже рознесли як доказ того, що агенти дозріли до справжньої роботи. У самому бенчмарку є деталь важливіша за рекорд: умова, за якої рекорд узагалі став можливий. Саме від неї залежить, чи спрацює автоматизація у вашій компанії; розмір моделі тут другорядний.
Що таке MirrorCode і чому це не черговий бенчмарк про код
MirrorCode розробили Epoch AI і METR, щоб перевірити AI на довгих задачах, а не на латанні окремих багів. Постановка жорстка: моделі дають працюючу програму, але тільки через командний рядок. Вихідного коду немає, інтернету немає, підглянути ніде. Треба самостійно зрозуміти, що ця програма робить, і написати власну реалізацію, яка поводитиметься так само.
Перевіряють результат наскрізними тестами, яких агент ніколи не бачив, і вивід має збігтися точно. Підмінити роботу таблицею готових відповідей неможливо, саме тому тести й тримають прихованими.
Двадцять п'ять цільових програм охоплюють різні куточки computer science: unix-утиліти, серіалізацію та запити до даних, біоінформатику, інтерпретатори, статичний аналіз, криптографію, стиснення. Для масштабу — три приклади з набору:
Програма | Що робить | Обсяг |
|---|---|---|
pkl | мова програмованої конфігурації, розробка Apple | 61 000 рядків |
qsv_select | вибір і перевпорядкування колонок CSV | 87 000 рядків |
gotree | робота з філогенетичними деревами, 40+ команд | 16 000 рядків |
Головна відмінність від звичних бенчмарків — гроші. Більшість тестів обмежують витрати на один прогін сумою в $1–10, навіть коли задача людині коштувала б тижнів. Тут бюджет дали такий, щоб спроба була серйозною. У лідерборді кожна спроба отримує до 10 мільярдів токенів і до 7 діб; прогони зі статті йшли за іншим правилом — обмеження було за токенами, а стеля за часом не ставилася взагалі. Саме звідти цифра в 19 діб безперервної роботи, яку ви побачите нижче.
Цифри, які варто тримати перед очима
Нижче — те, що Epoch AI опублікувала як результат, разом з тим, що зазвичай губиться в переказах: скільки цілей моделі не взяли.
Що виміряли | Результат |
|---|---|
gotree, Claude Opus 4.7 | 14 годин, $251 |
Оцінка тієї ж роботи для інженера без AI | 2–17 тижнів |
gotree різними мовами, Opus 4.7 і GPT-5.5 | $100–400 за прогін |
Найбільша задача набору (прогін зі статті, без ліміту часу) | $2 600, 19 діб роботи без втручання людини |
Цілі, де був хоча б один бездоганний прогін | 17 із 25 |
Цілі, не взяті на 100% жодного разу | 8 із 25 |
З цих восьми: дійшли до 99%, але не до 100% | 4 |
З цих восьми: не дотягнули й до 99% | 4 |
Провідні моделі роком раніше | близько 30% за метрикою бенчмарку, і лише прості програми на кшталт календаря |
За рік межа зсунулася з календарної утиліти до мови конфігурації від Apple, і цей темп означає, що будь-яке рішення «AI такого не вміє» має термін придатності близько року.
Де AI провалився
Вісім програм із двадцяти п'яти не піддалися на сто відсотків жодного разу, чотири — навіть на дев'яносто дев'ять. Найгірше моделям дався ruff, лінтер і форматувальник коду Python. У тому ж списку опинилися giac_subset, математичний пакет, і mailauth, бібліотека автентифікації електронної пошти.
Автори бенчмарку констатують факт провалу, але не пояснюють його причину, тож наступний абзац — наша інтерпретація, а не висновок Epoch AI.
Провалився при цьому не найбільший проєкт: гігантський qsv_select моделі брали, а лінтер ні. Лінтер є втіленням домовленостей: сотні дрібних рішень про те, який запис вважати правильним, ухвалених за роки й зафіксованих у поведінці, а не в описі. Спитайте двох Python-розробників, скільки порожніх рядків має стояти перед вкладеною функцією, і почуєте суперечку, якої немає в жодній специфікації. Відтворити таку систему з поведінки складніше, ніж велику, але послідовну. Те саме стосується криптографічно чутливої логіки в mailauth, де «майже правильно» дорівнює «неправильно».
Та сама межа проходить і в бізнесі: обсяг роботи AI витягує, а неписані домовленості компанії про те, що вважати правильним, — ні.
Умова, за якої довга автономія взагалі можлива
У MirrorCode є те, чого немає майже в жодному бізнес-процесі: безсуперечне машинне визначення готовності. «Готово» тут означає, що вивід збігся з еталонним на тестах, яких агент не бачив. Не «схоже», не «в цілому ок» і не «керівник глянув і кивнув».
Саме тому агент витримує 14 годин, а на найбільшій задачі зі статті — 19 діб поспіль без людини. Модель усередині прогону помиляється скільки завгодно разів, і кожна помилка коштує токенів: її ловить машина, ловить миттєво і безкоштовно.
Довжина автономної роботи агента дорівнює не силі моделі, а тому, наскільки дешево перевірити результат. Немає дешевої перевірки — немає довгої автономії, хоч яку модель ви поставите.
Ту саму залежність з іншого боку ми розбирали в матеріалі про те, чому в різних компаній однаковий агент дає різний результат.
Тут доречна й чесна засторога від самих авторів. Цільові програми — це реальний відкритий код, тож моделі майже напевно бачили їх під час навчання. Epoch AI прогнала перевірку на запам'ятовування і зазначає, що AI успішно переписав кілька програм, які цю перевірку пройшли, а на частині програм із ознаками запам'ятовування — навпаки, провалився. Тобто результат не зводиться до зубріння, але повністю виключити його внесок автори не беруться. Приймайте цифри як верхню оцінку, а не як гарантію.
Тест на вартість перевірки: перенос на SMB
Перш ніж питати «чи потягне агент цей процес», поставте три питання про сам процес.
- Чи існує еталон? Чи можна одним реченням описати правильно виконану роботу так, щоб двоє ваших співробітників зрозуміли опис однаково.
- Скільки коштує одна перевірка? Хвилина роботи junior-співробітника чи година часу керівника. Це визначає, скільки спроб ви взагалі можете собі дозволити.
- Що коштує пропущена помилка? Виправлений запис у базі — це одне; надіслана клієнту сума — зовсім інше.
Розкладіть свої процеси за цією логікою, і картина зазвичай виходить така:
Перевірка дешева й машинна | Перевірка дорога або суб'єктивна |
|---|---|
нормалізація товарного каталогу за заданою схемою | вибір позиціювання для нової послуги |
пошук і зведення дублів клієнтів | переговорна тактика в складній угоді |
розшифровка дзвінка у структуровані поля CRM | рішення, кому з двох постачальників віддати контракт |
звірка вивантаження з первинними документами | формулювання комерційної пропозиції під конкретного клієнта |
перевірка заявки на повноту даних | оцінка, чи варто утримувати клієнта, що йде |
Процеси з лівої колонки можна віддавати агенту вже зараз і рахувати ROI чесно. Права — не «AI сюди не зайде ніколи», а «тут агент працює під людиною, короткими кроками, і економія рахується інакше». Межу між вбудованим AI у процесі й повноцінною автономією ми розкладали окремо — коли автономність зайва.
Найчастіша помилка на цьому кроці — почати з процесу, який болить найбільше. Починати треба з процесу, який найдешевше перевірити: він дасть вам робочий вимір ефекту, а вже з ним можна йти до дорогих.
$251 — це багато чи мало
Порівняння $251 із двома-сімнадцятьма тижнями інженерної роботи виглядає нищівним, і саме в такому вигляді його зазвичай цитують. Варто додати три поправки.
Це вартість одного успішного прогону. У лідерборді кожну задачу проганяють тричі, і невдалі спроби так само спалюють бюджет, тож реальна вартість результату включає їх. Далі, це лабораторія: задача сформульована, середовище зібране, критерій готовності написаний до старту. У компанії саме ця підготовка і є найдорожчим рядком, а не інференс. І нарешті, $2 600 за найбільшу задачу нагадують, що довга автономія має ціну, яка росте разом з амбіцією.
Повний розклад того, з чого складається вартість агента поза лабораторією, лежить у розборі скільки насправді коштує AI-агент, а методика підрахунку віддачі — в матеріалі як рахувати ROI AI-агентів.
Що зробити цього тижня
- Виберіть один процес, який повторюється щотижня і зараз виконується руками.
- Напишіть критерій готовності одним реченням, у формі перевірки: «результат правильний, якщо збігається з X». Не вийшло сформулювати — це і є ваша перша задача, і вона не про AI.
- Порахуйте вартість однієї перевірки в хвилинах і в тому, чий це час.
- Оцініть ціну пропущеної помилки. Якщо вона висока, залишайте людину на виході й на першому етапі скорочуйте не контроль, а підготовку.
- Виміряйте одну метрику до і після: години на процес або кількість помилок на сотню операцій.
Якщо через два тижні метрика не зрушила, справа майже завжди в другому кроці. Ширший зріз того, що зараз реально працює в малому бізнесі, дає розбір стану AI-агентів для SMB у 2026 році, а базове введення в тему — AI-агенти для малого бізнесу.
Джерела
- Epoch AI × METR, MirrorCode: What's the largest software project AI can complete on its own? — сторінка бенчмарку з результатами й застереженнями авторів.
- Tom Adamczewski, David Owen, David Rein та ін., MirrorCode: AI can rebuild entire programs from behavior alone, arXiv 2606.30182, 2026 — повна стаття.
- Jack Clark, Import AI 466, 27 липня 2026 — розбір результатів і теза про здатність систем самостійно орієнтуватися в незнайомому середовищі.
- Вихідний код і 22 із 25 цільових програм (Epoch Research, GitHub).
Наступний крок. Пройдіть безкоштовний AI-аудит за дві хвилини: він показує, у яких ваших процесах результат перевіряється дешево, а де спершу треба навести лад у даних. Склад наших front-office агентів — на окремій сторінці.
Якщо у вашому оточенні хтось саме зараз обирає перший процес під автоматизацію, перешліть йому таблицю з двома колонками вище: вона економить місяць спроб не з того боку.
Опубліковано Andrew Maryasov, засновником Grow2.ai — AI-агенти та AI-консалтинг для малого й середнього бізнесу. Grow2.ai — AI-підрозділ Auspex.