← Todos los posts

Ensayo · Por Andrew Maryasov, fundador de Grow2.ai ·

Agente de IA autónomo: 14 horas en lugar de 2 a 17 semanas de trabajo

Infografía: Agente de IA autónomo: 14 horas en lugar de 2 a 17 semanas de trabajo

En una ejecución del benchmark MirrorCode en el verano de 2026, el modelo Claude puntero entonces (Opus 4.7) reescribió desde cero un programa de dieciséis mil líneas en 14 horas, con un gasto de $251 en inferencia. A ingenieros humanos sin IA, Epoch AI y METR les asignaron entre dos y diecisiete semanas para ese mismo trabajo.

La cifra ya circuló como prueba de que los agentes maduraron para el trabajo real. En el propio benchmark hay un detalle más importante que el récord: la condición que hizo posible ese récord. De ella depende que la automatización funcione en su empresa; el tamaño del modelo es secundario.

Qué es MirrorCode y por qué no es otro benchmark sobre código

Epoch AI y METR desarrollaron MirrorCode para probar la IA en tareas largas y no en el parcheo de errores sueltos. El planteo es duro: al modelo se le da un programa en funcionamiento, pero solo a través de la línea de comandos. No hay código fuente, no hay internet, no hay dónde espiar. Debe entender por su cuenta qué hace ese programa y escribir una implementación propia que se comporte igual.

El resultado se verifica con pruebas de extremo a extremo que el agente nunca vio, y la salida debe coincidir exactamente. Sustituir el trabajo por una tabla de respuestas listas es imposible, y por eso las pruebas se mantienen ocultas.

Los veinticinco programas objetivo cubren distintos rincones de las ciencias de la computación: utilidades unix, serialización y consultas de datos, bioinformática, intérpretes, análisis estático, criptografía, compresión. Tres ejemplos del conjunto, para dar escala:

Programa

Qué hace

Tamaño

pkl

lenguaje de configuración programable, desarrollo de Apple

61 000 líneas

qsv_select

selección y reordenamiento de columnas CSV

87 000 líneas

gotree

trabajo con árboles filogenéticos, más de 40 comandos

16 000 líneas

La diferencia principal con los benchmarks habituales es el dinero. La mayoría limita el gasto de una ejecución a $1–10, incluso cuando la tarea le costaría semanas a una persona. Aquí el presupuesto se fijó para que el intento fuera serio. En la tabla de posiciones cada intento recibe hasta 10 mil millones de tokens y hasta 7 días; las ejecuciones del artículo siguieron otra regla: el límite era de tokens y no había techo de tiempo. De ahí sale la cifra de 19 días de trabajo continuo que verá más abajo.

Las cifras que conviene tener a la vista

Abajo está lo que Epoch AI publicó como resultado, junto con lo que suele perderse en los resúmenes: cuántos objetivos no lograron los modelos.

Qué midió el benchmark MirrorCode

Resultado

gotree, Claude Opus 4.7

14 horas, $251

Estimación del mismo trabajo para un ingeniero sin IA

2–17 semanas

gotree en distintos lenguajes, el mismo benchmark, Opus 4.7 y GPT-5.5

$100–400 por ejecución

La tarea más grande del conjunto (ejecución del artículo, sin límite de tiempo)

$2 600, 19 días de trabajo sin intervención humana

Objetivos con al menos una ejecución impecable

17 de 25

Objetivos nunca alcanzados al 100%

8 de 25

De esos ocho: llegaron al 99% pero no al 100%

4

De esos ocho: no llegaron ni al 99%

4

Modelos líderes un año antes

alrededor del 30% según la métrica del benchmark, y solo programas simples como un calendario

En un año la frontera pasó de una utilidad de calendario a un lenguaje de configuración de Apple, y ese ritmo significa que cualquier veredicto de «la IA no sabe hacer eso» tiene una vida útil de alrededor de un año.

Dónde falló la IA

Ocho programas de veinticinco no cedieron al cien por ciento en ninguna ejecución, y cuatro ni siquiera al noventa y nueve. Lo peor les resultó ruff, un linter y formateador de código Python. En la misma lista quedaron giac_subset, un paquete matemático, y mailauth, una biblioteca de autenticación de correo electrónico.

Los autores del benchmark constatan el fracaso pero no explican su causa, así que el párrafo siguiente es nuestra interpretación y no una conclusión de Epoch AI.

El que falló no fue el proyecto más grande: los modelos resolvieron el gigantesco qsv_select y no el linter. Un linter es la encarnación de los acuerdos: cientos de decisiones menores sobre qué escritura se considera correcta, tomadas a lo largo de años y fijadas en el comportamiento, no en la documentación. Pregúnteles a dos desarrolladores de Python cuántas líneas en blanco van antes de una función anidada y escuchará una discusión que no aparece en ninguna especificación. Reproducir un sistema así a partir del comportamiento es más difícil que reproducir uno grande pero consistente. Lo mismo vale para la lógica criptográficamente sensible de mailauth, donde «casi correcto» equivale a «incorrecto».

Ese mismo límite atraviesa el negocio: el volumen de trabajo la IA lo sostiene; los acuerdos no escritos de la empresa sobre qué se considera correcto, no.

La condición sin la cual la autonomía larga no es posible

MirrorCode tiene algo que casi ningún proceso de negocio tiene: una definición de «terminado» que la máquina resuelve sin discusión. Aquí «terminado» significa que la salida coincidió con la de referencia en pruebas que el agente no vio. No «se parece», no «en general está bien» y no «el jefe lo miró y asintió».

Por eso el agente aguanta 14 horas y, en la tarea más grande del artículo, 19 días seguidos sin una persona. El modelo puede equivocarse dentro de una ejecución tantas veces como quiera, y cada error cuesta tokens: lo atrapa la máquina, al instante y gratis.

La duración del trabajo autónomo de un agente no la fija la potencia del modelo, sino lo barato que resulte verificar el resultado. Sin verificación barata no hay autonomía larga, con el modelo que sea.

Esa misma dependencia, vista desde el otro lado, la analizamos en el material sobre por qué un mismo agente da resultados distintos en empresas distintas.

Aquí corresponde también la advertencia honesta de los propios autores. Los programas objetivo son código abierto real, de modo que los modelos casi con seguridad los vieron durante el entrenamiento. Epoch AI corrió una verificación de memorización y señala que la IA reescribió con éxito varios programas que la superaron, mientras que falló en parte de aquellos con señales de memorización. Es decir, el resultado no se reduce a recordar, aunque los autores no se animan a descartar del todo ese aporte. Tome las cifras como una estimación máxima, no como una garantía.

La prueba del costo de verificación: cómo se traslada a una pyme

Antes de preguntar «¿el agente aguanta este proceso?», hágase tres preguntas sobre el proceso mismo.

  1. ¿Existe una referencia? ¿Puede describir en una sola frase el trabajo bien hecho, de modo que dos de sus empleados entiendan la descripción igual?
  2. ¿Cuánto cuesta una verificación? Un minuto de trabajo de un junior o una hora del tiempo del jefe. Eso determina cuántos intentos puede permitirse.
  3. ¿Cuánto cuesta un error que pasó inadvertido? Un registro corregido en la base de datos es una cosa; un monto ya enviado al cliente es otra muy distinta.

Ordene sus procesos con esa lógica y el panorama suele quedar así:

La verificación es barata y automática

La verificación es cara o subjetiva

normalización del catálogo de productos según un esquema dado

elección del posicionamiento de un servicio nuevo

búsqueda y fusión de clientes duplicados

táctica de negociación en un acuerdo complejo

transcripción de una llamada a campos estructurados del CRM

decidir a cuál de dos proveedores darle el contrato

conciliación de una exportación con los documentos originales

redacción de una propuesta para un cliente concreto

revisión de una solicitud para ver si faltan datos

evaluar si conviene retener a un cliente que se va

Los procesos de la columna izquierda ya se le pueden dar a un agente y calcular el ROI con datos. La derecha no es «la IA nunca entrará aquí», sino «aquí el agente trabaja bajo una persona, en pasos cortos, y el ahorro se cuenta de otra manera». El límite entre la IA integrada en un proceso y la autonomía completa lo desarrollamos aparte, en cuándo la autonomía sobra.

El error más frecuente en este paso es empezar por el proceso que más duele. Hay que empezar por el proceso más barato de verificar: le dará una medición real del efecto, y con eso en la mano ya puede ir por los caros.

$251, ¿es mucho o es poco?

Comparar $251 con dos a diecisiete semanas de trabajo de ingeniería resulta demoledor, y así es como suele citarse. Conviene añadir tres correcciones.

Es el costo de una ejecución exitosa . En la tabla de posiciones cada tarea se corre tres veces, y los intentos fallidos también queman presupuesto, así que el costo real del resultado los incluye. Además, esto es un laboratorio: la tarea está formulada, el entorno armado, el criterio de «terminado» escrito antes de arrancar. En una empresa esa preparación es justamente la partida más cara, no la inferencia. Y por último, los $2 600 de la tarea más grande recuerdan que la autonomía larga tiene un precio que crece junto con la ambición.

El desglose completo de lo que compone el costo de un agente fuera del laboratorio está en el análisis sobre cuánto cuesta de verdad un agente de IA, y la metodología para calcular el retorno, en el material sobre cómo calcular el ROI de los agentes de IA.

Qué hacer esta semana

  1. Elija un proceso que se repita cada semana y hoy se haga a mano.
  2. Escriba el criterio de «terminado» en una frase, con forma de verificación: «el resultado es correcto si coincide con X». Si no logra formularlo, esa es su primera tarea, y no tiene que ver con la IA.
  3. Calcule el costo de una verificación en minutos y de quién es ese tiempo.
  4. Estime el precio de un error que pase inadvertido. Si es alto, deje una persona al final y en la primera etapa recorte la preparación, no el control.
  5. Mida una métrica antes y después: horas por proceso o cantidad de errores por cada cien operaciones.

Si en dos semanas la métrica no se movió, el asunto casi siempre está en el segundo paso. Un corte más amplio de lo que hoy funciona de verdad en la pequeña empresa está en el análisis del estado de los agentes de IA para pymes en 2026, y la introducción básica al tema, en agentes de IA para pequeñas empresas.


Fuentes

Siguiente paso. Haga la auditoría de IA gratuita en dos minutos: muestra en cuáles de sus procesos el resultado se verifica barato y dónde primero hay que ordenar los datos. La lista de nuestros agentes de front-office está en una página aparte.

Si alguien en su entorno está eligiendo ahora mismo su primer proceso para automatizar, reenvíele la tabla de dos columnas de arriba: ahorra un mes de intentos por el lado equivocado.

Publicado por Andrew Maryasov, fundador de Grow2.ai — agentes de IA y consultoría de IA para pequeñas y medianas empresas. Grow2.ai es la división de IA de Auspex.

Preguntas frecuentes

¿Qué es MirrorCode en palabras simples?

Es un benchmark de Epoch AI y METR en el que la IA accede a un programa en funcionamiento solo a través de la línea de comandos y debe escribir su propio programa que se comporte igual. No hay código fuente ni internet, y el resultado se verifica con pruebas de extremo a extremo que el modelo nunca vio. El conjunto tiene 25 programas objetivo en seis lenguajes de programación.

¿Significa que la IA va a reemplazar a los desarrolladores?

No, y el propio benchmark lo muestra: 8 de 25 programas no se reescribieron al 100% ni una sola vez. La IA resolvió tareas donde una máquina verifica la corrección por coincidencia exacta de la salida. El trabajo de un desarrollador consiste en su mayor parte en otra cosa —entender qué hay que construir y acordar los criterios— y esa parte no está en MirrorCode por diseño.

¿Por qué 8 de los 25 programas resistieron?

Epoch AI nombra los objetivos más difíciles —ruff, un linter y formateador de Python, el paquete matemático giac_subset y la biblioteca de autenticación de correo mailauth— pero no explica las causas. Según nuestra lectura en Grow2.ai, no es cuestión de tamaño: los modelos resolvieron programas mucho mayores. La dificultad está en los acuerdos implícitos sobre qué se considera una salida correcta, que nunca están escritos por completo.

¿Puedo darle a un agente de IA una tarea de una semana en mi empresa?

No depende del modelo, sino de si el resultado se puede verificar por máquina y barato. Si el proceso tiene una referencia con la que la salida se compara de forma automática, el trabajo autónomo largo es realista. Si «terminado» lo define la opinión de un jefe, conviene poner al agente en pasos cortos con revisión humana al final.

¿Cuánto cuesta el trabajo autónomo largo de la IA?

En MirrorCode una implementación exitosa de gotree costó $251, las ejecuciones de la misma tarea en distintos lenguajes costaron entre $100 y $400, y la tarea más grande del conjunto costó $2 600 por 19 días de trabajo continuo (la ejecución del artículo, sin techo de tiempo). Es el costo de inferencia en condiciones de laboratorio, sin contar los intentos fallidos ni la preparación de la tarea. En un proyecto real la partida principal es poner los datos y el proceso en condiciones, no los tokens.

¿Qué es la contaminación de datos y arruina estos resultados?

Los programas objetivo de MirrorCode son código abierto real, así que los modelos casi con seguridad los vieron durante el entrenamiento, y eso puede inflar la evaluación. Epoch AI corrió una verificación de memorización: la IA reescribió con éxito varios programas que la superaron y falló en parte de aquellos donde aparecieron señales de memorización. Los autores concluyen que el resultado no se reduce a recordar, pero no descartan del todo ese aporte.

¿Por dónde empieza una pyme después de esta noticia?

No por elegir modelo, sino por inventariar los procesos según el costo de verificar el resultado. Tome un proceso semanal repetitivo, formule el criterio de «terminado» como una verificación automática y mida una métrica antes de empezar. Grow2.ai lanza pilotos desde €1 800 (Starter, 14 días) con un KPI contractual. El piloto se paga por adelantado; si en la revisión del día 30 el KPI acordado no se ha movido, devolvemos el importe íntegro.

Agentes de IA para empresas — 2–3 emails al mes

Análisis, casos y herramientas que ya funcionan dentro de empresas.

Sin spam. Puedes darte de baja en un clic.