Resultado, restrições e verificação
O goal.md diz o resultado em uma frase e lista critérios no formato comando → saída esperada. Nada de "até ficar bom".
Área Execução Longa · agentes que trabalham horas e dias
Não é mandar o agente "trabalhar 10 horas". É dar um objetivo com prova de pronto, guardar o estado em arquivos e pôr tetos. O agente trabalha em ciclos — Codex /goal, Claude Code /goal ou um loop sem interface — e quem decide que acabou é o teste, não ele. Esta área junta o método, o kit execucao-longa e todos os cursos e projetos do INEMA sobre loops, contexto e memória de agentes.
Guia do kit em PT, EN e ES. Testado em execuções reais. Tudo aberto.
01 · O método
Uma sessão longa falha de três jeitos: o agente não sabe quando parar, esquece o que já fez depois de compactar ou gasta o que não devia. O método responde a cada um com uma peça.
O goal.md diz o resultado em uma frase e lista critérios no formato comando → saída esperada. Nada de "até ficar bom".
goal, plan, state, progress, failures e decisions.md guardam a tarefa; canal.md guarda o que a compactação perde. Depois de compactar ou retomar, o agente relê os arquivos.
Tempo, tokens e memória com teto. Crédito, API paga, produção e ação irreversível viram portão humano: o agente para e pergunta.
O agente escolhe a próxima ação útil, testa, registra e continua. Três ciclos sem avanço mensurável = parar e chamar o humano.
O mesmo objetivo e o mesmo histórico ao longo de horas.
Resume o histórico antigo para caber na janela. Muda o prefixo e o cache cai logo depois — é esperado.
Reaproveita o prefixo idêntico. Em sessão contínua o acerto passa de 95%. Meça cached ÷ input.
02 · Como rodar
Instale uma vez por máquina (regras globais, hook de contexto e vigia). Depois, cada objetivo longo ganha a própria pasta de estado e segue um dos dois caminhos.
Interativo · você acompanha
tools/novo-longrun.sh <projeto> <slug> cria a pasta com os sete arquivos.goal.md com critérios nível 3./goal no Codex ou no Claude Code, com o prompt de templates/./goals, /goal pause|resume, /side.medir-sessao.py: duração, compactações, tokens e cache.Headless · roda sozinho
prompt.md e loop.env.tools/loop-longrun.sh <pasta> — cada ciclo é um codex exec com teto de tempo e memória.# 1. pasta de estado da execução ~/projetos/execucao-longa/tools/novo-longrun.sh ~/projetos/meu-projeto meu-objetivo # 2. goal.md: resultado + critérios "comando → saída esperada" # 3a. interativo codex # → /goal com templates/prompt-goal-codex.md # 3b. headless ~/projetos/execucao-longa/tools/loop-longrun.sh meu-projeto/longrun/2026-10-01-meu-objetivo # 4. feche e meça python3 ~/projetos/execucao-longa/tools/medir-sessao.py <sessão.jsonl>
Pare e intervenha se: passarem 3 ciclos sem avanço mensurável; o agente repetir "vou terminar e commitar" sem terminar, ou reabrir item já feito; ou chegar à 3ª compactação na mesma sessão — aí é handoff e sessão nova.
03 · Critério de pronto
Em execução longa, o mínimo é o nível 3. Abaixo disso, o agente se autoaprova ou cumpre a letra sem fazer o trabalho.
tests/ intocado". Mínimo aceito./goal no Claude só lê a conversa)? Cobre função, regressão e limite?04 · Contexto e memória
/goal que deteriora. É a compactação repetida.O objetivo sobrevive à compactação, mas o "o que já está feito / o que falta" se perde: o agente reabre trabalho e não converge. O kit trata isso antes do limite automático.
~50% → anotar no canal.md. ~70% → atualizar o estado e /compact. ~85% ou 3ª compactação → /session-handoff, sessão nova e /prime. Um hook do Claude Code avisa uma vez por faixa.
Se o orquestrador dorme entre ciclos: OpenAI ~30 min (acordar a cada ~25), Claude 1 h (~55). Perder o cache custa de 12,5x a 25x.
Uma tarefa por arquivo, fechar só com evidência, no máximo 5 tarefas criadas pelo agente. Fila vazia → registrar e parar.
recall "termo"Índice SQLite FTS5 de tudo o que foi dito com o Codex e o Claude, reindexado de hora em hora — 90 mil trechos, busca em centésimos de segundo.
tools/vigia.py a cada 10 min (timer systemd): execução parada, parada sem aviso ou ociosa.
medir-sessao.pyLê 1,8 GB de sessão em ~9 s: duração, compactações, tokens, cache e saída de ferramenta, por turno.
05 · Áreas relacionadas
Ciclos de melhoria em IA: o loop que aprende com evidência.
Abrir a área → ÁreaMeta com condição de parada, handoff e prime — um faz, o outro confere.
Abrir a área → ÁreaComandar agentes que trabalham sozinhos.
Abrir a área → ÁreaGerenciar agentes: delegar, limitar e supervisionar.
Abrir a área →06 · Projetos e cursos
Método, templates, loop headless, hook de contexto, vigia, medição de sessão e recall.
Statusline com cota real, checkpoint, auditoria de memória e handoff antes do /clear.
Núcleo portátil e handoff entre sessões e agentes.
Abrir o guia → FrameworkLoops autoaperfeiçoáveis: evidência, hipótese, experimento, promoção e rollback.
Abrir o guia →Sistemas com IA no loop.
Abrir o curso → CursoEngenharia de loops.
Abrir o curso → CursoDe loops a grafos de agentes.
Abrir o curso → CursoSua empresa que aprende sozinha.
Abrir o curso → CursoMestre em contexto e tokens.
Abrir o curso → CursoPrompt caching no Claude Code.
Abrir o curso → CursoInjeção de memória via hooks.
Abrir o curso → CursoFormação de Engenharia de Contexto.
Abrir o curso → CursoUm faz, o outro confere.
Abrir o curso → CursoDelegar, verificar, iterar e escalar com Codex.
Abrir o curso → CursoDesenvolvimento com agentes: planos, testes e verificação.
Abrir o curso →07 · Comece agora
Escolha uma tarefa que um teste consiga provar, crie a pasta com novo-longrun.sh, escreva o goal.md e rode um ciclo. Depois meça a sessão.
Templates, loop headless, hook de contexto, vigia, medição e recall.
Sessões enxutas no Claude Code: cota real, checkpoint e handoff.
Abrir o guia →Um planeja, o outro desafia — e a meta com condição de parada.
Abrir a área →Dúvida sobre por onde começar? Fale com a gente no Telegram.