En una ejecución del benchmark MirrorCode en el verano de 2026, el modelo Claude puntero entonces (Opus 4.7) reescribió desde cero un programa de dieciséis mil líneas en 14 horas, con un gasto de $251 en inferencia. A ingenieros humanos sin IA, Epoch AI y METR les asignaron entre dos y diecisiete semanas para ese mismo trabajo.
La cifra ya circuló como prueba de que los agentes maduraron para el trabajo real. En el propio benchmark hay un detalle más importante que el récord: la condición que hizo posible ese récord. De ella depende que la automatización funcione en su empresa; el tamaño del modelo es secundario.
Qué es MirrorCode y por qué no es otro benchmark sobre código
Epoch AI y METR desarrollaron MirrorCode para probar la IA en tareas largas y no en el parcheo de errores sueltos. El planteo es duro: al modelo se le da un programa en funcionamiento, pero solo a través de la línea de comandos. No hay código fuente, no hay internet, no hay dónde espiar. Debe entender por su cuenta qué hace ese programa y escribir una implementación propia que se comporte igual.
El resultado se verifica con pruebas de extremo a extremo que el agente nunca vio, y la salida debe coincidir exactamente. Sustituir el trabajo por una tabla de respuestas listas es imposible, y por eso las pruebas se mantienen ocultas.
Los veinticinco programas objetivo cubren distintos rincones de las ciencias de la computación: utilidades unix, serialización y consultas de datos, bioinformática, intérpretes, análisis estático, criptografía, compresión. Tres ejemplos del conjunto, para dar escala:
Programa | Qué hace | Tamaño |
|---|---|---|
pkl | lenguaje de configuración programable, desarrollo de Apple | 61 000 líneas |
qsv_select | selección y reordenamiento de columnas CSV | 87 000 líneas |
gotree | trabajo con árboles filogenéticos, más de 40 comandos | 16 000 líneas |
La diferencia principal con los benchmarks habituales es el dinero. La mayoría limita el gasto de una ejecución a $1–10, incluso cuando la tarea le costaría semanas a una persona. Aquí el presupuesto se fijó para que el intento fuera serio. En la tabla de posiciones cada intento recibe hasta 10 mil millones de tokens y hasta 7 días; las ejecuciones del artículo siguieron otra regla: el límite era de tokens y no había techo de tiempo. De ahí sale la cifra de 19 días de trabajo continuo que verá más abajo.
Las cifras que conviene tener a la vista
Abajo está lo que Epoch AI publicó como resultado, junto con lo que suele perderse en los resúmenes: cuántos objetivos no lograron los modelos.
Qué midió el benchmark MirrorCode | Resultado |
|---|---|
gotree, Claude Opus 4.7 | 14 horas, $251 |
Estimación del mismo trabajo para un ingeniero sin IA | 2–17 semanas |
gotree en distintos lenguajes, el mismo benchmark, Opus 4.7 y GPT-5.5 | $100–400 por ejecución |
La tarea más grande del conjunto (ejecución del artículo, sin límite de tiempo) | $2 600, 19 días de trabajo sin intervención humana |
Objetivos con al menos una ejecución impecable | 17 de 25 |
Objetivos nunca alcanzados al 100% | 8 de 25 |
De esos ocho: llegaron al 99% pero no al 100% | 4 |
De esos ocho: no llegaron ni al 99% | 4 |
Modelos líderes un año antes | alrededor del 30% según la métrica del benchmark, y solo programas simples como un calendario |
En un año la frontera pasó de una utilidad de calendario a un lenguaje de configuración de Apple, y ese ritmo significa que cualquier veredicto de «la IA no sabe hacer eso» tiene una vida útil de alrededor de un año.
Dónde falló la IA
Ocho programas de veinticinco no cedieron al cien por ciento en ninguna ejecución, y cuatro ni siquiera al noventa y nueve. Lo peor les resultó ruff, un linter y formateador de código Python. En la misma lista quedaron giac_subset, un paquete matemático, y mailauth, una biblioteca de autenticación de correo electrónico.
Los autores del benchmark constatan el fracaso pero no explican su causa, así que el párrafo siguiente es nuestra interpretación y no una conclusión de Epoch AI.
El que falló no fue el proyecto más grande: los modelos resolvieron el gigantesco qsv_select y no el linter. Un linter es la encarnación de los acuerdos: cientos de decisiones menores sobre qué escritura se considera correcta, tomadas a lo largo de años y fijadas en el comportamiento, no en la documentación. Pregúnteles a dos desarrolladores de Python cuántas líneas en blanco van antes de una función anidada y escuchará una discusión que no aparece en ninguna especificación. Reproducir un sistema así a partir del comportamiento es más difícil que reproducir uno grande pero consistente. Lo mismo vale para la lógica criptográficamente sensible de mailauth, donde «casi correcto» equivale a «incorrecto».
Ese mismo límite atraviesa el negocio: el volumen de trabajo la IA lo sostiene; los acuerdos no escritos de la empresa sobre qué se considera correcto, no.
La condición sin la cual la autonomía larga no es posible
MirrorCode tiene algo que casi ningún proceso de negocio tiene: una definición de «terminado» que la máquina resuelve sin discusión. Aquí «terminado» significa que la salida coincidió con la de referencia en pruebas que el agente no vio. No «se parece», no «en general está bien» y no «el jefe lo miró y asintió».
Por eso el agente aguanta 14 horas y, en la tarea más grande del artículo, 19 días seguidos sin una persona. El modelo puede equivocarse dentro de una ejecución tantas veces como quiera, y cada error cuesta tokens: lo atrapa la máquina, al instante y gratis.
La duración del trabajo autónomo de un agente no la fija la potencia del modelo, sino lo barato que resulte verificar el resultado. Sin verificación barata no hay autonomía larga, con el modelo que sea.
Esa misma dependencia, vista desde el otro lado, la analizamos en el material sobre por qué un mismo agente da resultados distintos en empresas distintas.
Aquí corresponde también la advertencia honesta de los propios autores. Los programas objetivo son código abierto real, de modo que los modelos casi con seguridad los vieron durante el entrenamiento. Epoch AI corrió una verificación de memorización y señala que la IA reescribió con éxito varios programas que la superaron, mientras que falló en parte de aquellos con señales de memorización. Es decir, el resultado no se reduce a recordar, aunque los autores no se animan a descartar del todo ese aporte. Tome las cifras como una estimación máxima, no como una garantía.
La prueba del costo de verificación: cómo se traslada a una pyme
Antes de preguntar «¿el agente aguanta este proceso?», hágase tres preguntas sobre el proceso mismo.
- ¿Existe una referencia? ¿Puede describir en una sola frase el trabajo bien hecho, de modo que dos de sus empleados entiendan la descripción igual?
- ¿Cuánto cuesta una verificación? Un minuto de trabajo de un junior o una hora del tiempo del jefe. Eso determina cuántos intentos puede permitirse.
- ¿Cuánto cuesta un error que pasó inadvertido? Un registro corregido en la base de datos es una cosa; un monto ya enviado al cliente es otra muy distinta.
Ordene sus procesos con esa lógica y el panorama suele quedar así:
La verificación es barata y automática | La verificación es cara o subjetiva |
|---|---|
normalización del catálogo de productos según un esquema dado | elección del posicionamiento de un servicio nuevo |
búsqueda y fusión de clientes duplicados | táctica de negociación en un acuerdo complejo |
transcripción de una llamada a campos estructurados del CRM | decidir a cuál de dos proveedores darle el contrato |
conciliación de una exportación con los documentos originales | redacción de una propuesta para un cliente concreto |
revisión de una solicitud para ver si faltan datos | evaluar si conviene retener a un cliente que se va |
Los procesos de la columna izquierda ya se le pueden dar a un agente y calcular el ROI con datos. La derecha no es «la IA nunca entrará aquí», sino «aquí el agente trabaja bajo una persona, en pasos cortos, y el ahorro se cuenta de otra manera». El límite entre la IA integrada en un proceso y la autonomía completa lo desarrollamos aparte, en cuándo la autonomía sobra.
El error más frecuente en este paso es empezar por el proceso que más duele. Hay que empezar por el proceso más barato de verificar: le dará una medición real del efecto, y con eso en la mano ya puede ir por los caros.
$251, ¿es mucho o es poco?
Comparar $251 con dos a diecisiete semanas de trabajo de ingeniería resulta demoledor, y así es como suele citarse. Conviene añadir tres correcciones.
Es el costo de una ejecución exitosa . En la tabla de posiciones cada tarea se corre tres veces, y los intentos fallidos también queman presupuesto, así que el costo real del resultado los incluye. Además, esto es un laboratorio: la tarea está formulada, el entorno armado, el criterio de «terminado» escrito antes de arrancar. En una empresa esa preparación es justamente la partida más cara, no la inferencia. Y por último, los $2 600 de la tarea más grande recuerdan que la autonomía larga tiene un precio que crece junto con la ambición.
El desglose completo de lo que compone el costo de un agente fuera del laboratorio está en el análisis sobre cuánto cuesta de verdad un agente de IA, y la metodología para calcular el retorno, en el material sobre cómo calcular el ROI de los agentes de IA.
Qué hacer esta semana
- Elija un proceso que se repita cada semana y hoy se haga a mano.
- Escriba el criterio de «terminado» en una frase, con forma de verificación: «el resultado es correcto si coincide con X». Si no logra formularlo, esa es su primera tarea, y no tiene que ver con la IA.
- Calcule el costo de una verificación en minutos y de quién es ese tiempo.
- Estime el precio de un error que pase inadvertido. Si es alto, deje una persona al final y en la primera etapa recorte la preparación, no el control.
- Mida una métrica antes y después: horas por proceso o cantidad de errores por cada cien operaciones.
Si en dos semanas la métrica no se movió, el asunto casi siempre está en el segundo paso. Un corte más amplio de lo que hoy funciona de verdad en la pequeña empresa está en el análisis del estado de los agentes de IA para pymes en 2026, y la introducción básica al tema, en agentes de IA para pequeñas empresas.
Fuentes
- Epoch AI × METR, MirrorCode: What's the largest software project AI can complete on its own? — página del benchmark con resultados y advertencias de los autores.
- Tom Adamczewski, David Owen, David Rein y otros, MirrorCode: AI can rebuild entire programs from behavior alone, arXiv 2606.30182, 2026 — artículo completo.
- Jack Clark, Import AI 466, 27 de julio de 2026 — análisis de los resultados y la tesis sobre la capacidad de estos sistemas para orientarse solos en un entorno desconocido.
- Código fuente y 22 de los 25 programas objetivo (Epoch Research, GitHub).
Siguiente paso. Haga la auditoría de IA gratuita en dos minutos: muestra en cuáles de sus procesos el resultado se verifica barato y dónde primero hay que ordenar los datos. La lista de nuestros agentes de front-office está en una página aparte.
Si alguien en su entorno está eligiendo ahora mismo su primer proceso para automatizar, reenvíele la tabla de dos columnas de arriba: ahorra un mes de intentos por el lado equivocado.
Publicado por Andrew Maryasov, fundador de Grow2.ai — agentes de IA y consultoría de IA para pequeñas y medianas empresas. Grow2.ai es la división de IA de Auspex.
