Área Ejecución Larga · agentes que trabajan horas y días

Agentes que trabajan por horas. Sin perder el rumbo.

No es pedirle al agente que "trabaje 10 horas". Es darle un objetivo con prueba de listo, guardar el estado en archivos y poner topes. El agente trabaja en ciclos — Codex /goal, Claude Code /goal o un loop sin interfaz — y quien decide que terminó es la prueba, no él. Esta área reúne el método, el kit execucao-longa y todos los cursos y proyectos de INEMA sobre loops, contexto y memoria de agentes.

Guía del kit en PT, EN y ES. Probado en ejecuciones reales. Todo abierto.

01 · El método

Tres piezas que dejan a un agente trabajar horas sin perderse.

Una sesión larga falla de tres maneras: el agente no sabe cuándo parar, olvida lo que ya hizo después de compactar o gasta lo que no debía. El método responde a cada una con una pieza.

🎯 Objetivo verificable

Resultado, restricciones y verificación

El goal.md dice el resultado en una frase y lista criterios en el formato comando → salida esperada. Nada de "hasta que quede bien".

🗂️ Estado en archivos

El agente relee, no recuerda

goal, plan, state, progress, failures y decisions.md guardan la tarea; canal.md guarda lo que la compactación pierde. Tras compactar o retomar, el agente relee los archivos.

🛡️ Topes y puertas

Límite en tiempo, tokens y gasto

Tiempo, tokens y memoria con tope. Créditos, API de pago, producción y acciones irreversibles se vuelven puerta humana: el agente se detiene y pregunta.

El agente elige la próxima acción útil, prueba, registra y sigue. Tres ciclos sin avance medible = detenerse y llamar al humano.

Objetivo→Lee estado→Próxima acción→Ejecuta→Prueba→Corrige→Guarda estado + commit↺
Continuidad

Sesión persistente

El mismo objetivo y el mismo historial a lo largo de horas.

Ventana

Compactación

Resume el historial antiguo para que quepa en la ventana. Cambia el prefijo y la caché cae justo después — es lo esperado.

Costo

Caché de prompt

Reaprovecha el prefijo idéntico. En sesión continua el acierto supera el 95%. Mide cached ÷ input.

02 · Cómo ejecutar

Dos caminos: tú acompañas, o corre solo.

Instala una vez por máquina (reglas globales, hook de contexto y vigía). Después, cada objetivo largo tiene su propia carpeta de estado y sigue uno de los dos caminos.

Interactivo · tú acompañas

  • tools/novo-longrun.sh <proyecto> <slug> crea la carpeta con los siete archivos.
  • Escribe el goal.md con criterios nivel 3.
  • /goal en Codex o en Claude Code, con el prompt de templates/.
  • Acompaña sin interrumpir: /goals, /goal pause|resume, /side.
  • Al final, medir-sessao.py: duración, compactaciones, tokens y caché.

Headless · corre solo

  • La misma carpeta, más prompt.md y loop.env.
  • Pruebas congeladas: la prueba es el juez.
  • tools/loop-longrun.sh <carpeta> — cada ciclo es un codex exec con tope de tiempo y memoria.
  • Revierte cambios en pruebas protegidas y hace commit de checkpoint.
  • Se detiene solo: concluido, 3 ciclos sin avance o tope de ciclos.
# 1. carpeta de estado de la ejecución
~/projetos/execucao-longa/tools/novo-longrun.sh ~/projetos/mi-proyecto mi-objetivo
# 2. goal.md: resultado + criterios "comando → salida esperada"
# 3a. interactivo
codex   # → /goal con templates/prompt-goal-codex.md
# 3b. headless
~/projetos/execucao-longa/tools/loop-longrun.sh mi-proyecto/longrun/2026-10-01-mi-objetivo
# 4. cierra y mide
python3 ~/projetos/execucao-longa/tools/medir-sessao.py <sesión.jsonl>

Detente e interviene si: pasan 3 ciclos sin avance medible; el agente repite "voy a terminar y hacer commit" sin terminar, o reabre lo que ya estaba hecho; o llega a la 3.ª compactación en la misma sesión — entonces es handoff y sesión nueva.

03 · Criterio de listo

Un buen criterio: alguien de fuera lo comprueba, y el agente no lo cumple por atajo.

En ejecución larga, el mínimo es el nivel 3. Por debajo, el agente se autoaprueba o cumple la letra sin hacer el trabajo.

0 · Vago"Dejar el sitio bien". Nadie sabe cuándo terminó.
1 · Subjetivo"Código revisado y limpio". El agente se autoaprueba.
2 · Burlable"0 fallos". Se puede borrar una prueba o generar una página vacía.
3 · Protegido ✅"0 fallos y ≥ 48 pruebas y tests/ intacto". Mínimo aceptado.
4 · IndependienteNivel 3 + comprobación externa: e2e real, evaluador separado, muestra humana.
Cinco preguntas — cada "no" baja el nivel. ¿Se puede comprobar con un comando? ¿La respuesta es sí/no? ¿Es imposible cumplirlo sin hacer el trabajo? ¿La prueba aparece en la salida (el evaluador del /goal en Claude solo lee la conversación)? ¿Cubre función, regresión y límite?

04 · Contexto y memoria

No es el /goal lo que se deteriora. Es la compactación repetida.

El objetivo sobrevive a la compactación, pero el "qué ya está hecho / qué falta" se pierde: el agente reabre trabajo y no converge. El kit lo trata antes del límite automático.

Franjas de contexto

50 · 70 · 85%

~50% → anotar en canal.md. ~70% → actualizar el estado y /compact. ~85% o 3.ª compactación → /session-handoff, sesión nueva y /prime. Un hook de Claude Code avisa una vez por franja.

Caché entre ciclos

Despierta antes de que expire

Si el orquestador duerme entre ciclos: OpenAI ~30 min (despertar cada ~25), Claude 1 h (~55). Perder la caché cuesta de 12,5x a 25x.

Modo cola

Un backlog que crece

Una tarea por archivo, cerrar solo con evidencia, como máximo 5 tareas creadas por el agente. Cola vacía → registrar y parar.

Memoria entre sesiones

recall "término"

Índice SQLite FTS5 de todo lo dicho con Codex y Claude, reindexado cada hora — 90 mil fragmentos, búsqueda en centésimas de segundo.

Vigía

Avisa ejecución detenida

tools/vigia.py cada 10 min (timer de systemd): ejecución detenida, parada sin aviso u ociosa.

Medición

medir-sessao.py

Lee 1,8 GB de sesión en ~9 s: duración, compactaciones, tokens, caché y salida de herramientas, por turno.

05 · Áreas relacionadas

Otras áreas de Eventos que dialogan con la ejecución larga.

06 · Proyectos y cursos

Loops, contexto y memoria de agentes: todo lo de INEMA en un solo lugar.

Proyectos y kits

Cursos (en portugués)

07 · Empieza ahora

El mejor primer paso: un objetivo pequeño, con criterio nivel 3.

Elige una tarea que una prueba pueda demostrar, crea la carpeta con novo-longrun.sh, escribe el goal.md y corre un ciclo. Después mide la sesión.

Kit · abierto

Ejecución Larga

Plantillas, loop headless, hook de contexto, vigía, medición y recall.

Abrir la guía →
Kit · abierto

claude-session-kit

Sesiones de Claude Code ligeras: cuota real, checkpoint y handoff.

Abrir la guía →
Área hermana

Codex + Claude

Uno planifica, el otro desafía — y la meta con condición de parada.

Abrir el área →

¿Dudas sobre por dónde empezar? Habla con nosotros en Telegram.