ÁREA DE ESTUDO · ACERVO ABERTO

RSI: a IA que ajuda a melhorar a IA

Como um sistema propõe mudanças, testa resultados e conserva o que funciona? Explore a automelhoria recursiva com referências, exemplos e critérios para avaliar as promessas.

Melhorar uma resposta, melhorar um agente e melhorar a capacidade de criar novos agentes são coisas diferentes.

Comece por aqui

CURSO · PT / EN / ES

RSI v6.2

18 aulas em seis módulos, com exercícios, revisão e materiais para aplicar o LOOP-R e registrar conhecimento aprovado. Disponível em português, inglês e espanhol.

Abrir curso

PROJETO · PT / EN / ES

Guia RSI

Mapa do tema, mecanismos, aplicações e limites. O projeto reúne pesquisa e conteúdo educativo; não é um sistema RSI autônomo pronto para executar.

Abrir guia

Além do guia de referência e do curso RSI v6.2, o acervo reúne os projetos Copiloto e Dream-RSI e o curso Alerta IA 2028.

Mais projetos e cursos sobre RSI

Explore aplicações, pesquisa e leitura crítica. Cada material indica o que já está disponível e em qual idioma.

PESQUISA · GUIA PT / EN / ES

Dream-RSI · google-rsi

Guia educativo independente sobre aprender com históricos de experimentos. Inclui cinco figuras dos autores, comparação interativa e atividade de compreensão. O laboratório e os oito encontros são planos futuros, não uma implementação do artigo.

Explorar Dream-RSI

CURSO · PT / EN / ES

Alerta IA 2028

Curso e explicação introdutória em três trilhas: o ciclo de melhoria, as evidências e os limites da avaliação. Apresenta cenários de 2028 como hipóteses a examinar, sem um calendário garantido.

Abrir Alerta IA 2028

FRAMEWORK E CURSO · PT / EN / ES

LOOP-R

O ciclo Executar → Medir → Criticar → Propor → Testar → Validar → Promover → Repetir, pronto para usar no Claude Code: nove assistentes com funções separadas, registro de cada versão, teto de custo e comando para reverter. Nenhuma versão pior substitui a atual por decisão do sistema. O curso tem cinco trilhas e 21 aulas para donos e gestores sem base técnica.

Abrir o framework LOOP-R

Fazer o curso LOOP-R

O que muda em cada nível

Revisar a resposta

O modelo critica e refaz uma saída. Isso pode melhorar uma tarefa sem alterar seus parâmetros ou seu processo de desenvolvimento.

Melhorar o sistema

Instruções, memória, ferramentas ou código do agente mudam. Compare versões com tarefas reservadas e preserve a possibilidade de voltar atrás.

Investigar a recursão

A melhoria passa a ajudar a produzir melhorias futuras. Esse mecanismo precisa de evidência: mais tentativas ou uma nota maior não demonstram crescimento ilimitado.

Da ideia a um teste verificável

Comece com uma tarefa pequena: responder com base numa política, criar questões a partir de um texto ou extrair ações de notas. O curso organiza esse trabalho com o LOOP-R, uma proposta conceitual do projeto.

  1. Defina a tarefa, a referência correta e os limites de dados, gasto e ações.
  2. Registre a versão inicial e separe casos de desenvolvimento de casos reservados para validação.
  3. Proponha uma mudança por vez e compare com os mesmos critérios, incluindo erros, custo e esforço de revisão.
  4. Valide antes de adotar. Guarde resultados e versões, defina quem decide e mantenha um caminho de reversão.

Uma avaliação conhecida pode ser explorada. Preserve a independência dos testes, confira dados inventados e resultados fora da amostra. Não confunda ganho local com autonomia geral.

Referências para aprofundar

Seleção da pesquisa do curso, consultada em 25 de setembro de 2026. Os links levam às publicações originais, em inglês. Resultados pertencem às condições dos estudos; não foram reproduzidos neste projeto.

  • Self-Refine

    Geração, crítica e revisão iterativa de respostas, sem exigir treinamento adicional no procedimento apresentado.

  • Reflexion

    Feedback verbal e memória episódica orientam tentativas posteriores sem atualizar os pesos do modelo.

  • Darwin Gödel Machine

    Agentes que modificam seu código e mantêm um arquivo de variantes. Evidência experimental em avaliações específicas.

  • AlphaEvolve · Google DeepMind

    Busca de programas com avaliação automática. Melhorias de componentes não equivalem a uma medida universal de inteligência.

  • Self-Rewarding Language Models

    O modelo participa da geração de recompensas em treinamento iterativo. Isso difere de pedir uma crítica numa conversa.

  • Reward tampering · Anthropic

    Experimentos sobre manipulação da recompensa reforçam a necessidade de proteger o processo de avaliação.

  • The Curse of Recursion

    Estuda degradação sob condições de treinamento com dados gerados. Não implica que todo dado sintético seja prejudicial.