ÁREA DE ESTUDIO · RECURSOS ABIERTOS

RSI: la IA que ayuda a mejorar la IA

¿Cómo propone cambios un sistema, prueba resultados y conserva lo que funciona? Explora la automejora recursiva con referencias, ejemplos y criterios para evaluar las promesas.

Mejorar una respuesta, mejorar un agente y mejorar la capacidad de crear nuevos agentes son cosas diferentes.

Empieza aquí

CURSO · PT / EN / ES

RSI v6.2

18 lecciones en seis módulos, con ejercicios, repaso y materiales para aplicar LOOP-R y registrar conocimiento aprobado. Disponible en portugués, inglés y español.

Abrir el curso en español

PROYECTO · PT / EN / ES

Guía RSI

Mapa del tema, mecanismos, aplicaciones y límites. El proyecto reúne investigación y contenido educativo; no es un sistema RSI autónomo listo para ejecutar.

Abrir la guía

Además de la guía de referencia y el curso RSI v6.2, la colección reúne los proyectos Copiloto y Dream-RSI y el curso Alerta IA 2028.

Más proyectos y cursos sobre RSI

Explora aplicaciones, investigación y lectura crítica. Cada recurso indica qué está disponible y en qué idioma.

INVESTIGACIÓN · GUÍA PT / EN / ES

Dream-RSI · google-rsi

Guía educativa independiente sobre aprender de historiales de experimentos. Incluye cinco figuras de los autores, una comparación interactiva y una actividad de comprensión. El laboratorio y los ocho encuentros son planes futuros, no una implementación del artículo.

Explorar Dream-RSI

CURSO · PT / EN / ES

Alerta IA 2028

Curso y explicación introductoria en tres rutas: el ciclo de mejora, las evidencias y los límites de la evaluación. Presenta escenarios de 2028 como hipótesis que examinar, sin un calendario garantizado.

Abrir Alerta IA 2028

FRAMEWORK Y CURSO · PT / EN / ES

LOOP-R

El ciclo Ejecutar → Medir → Criticar → Proponer → Probar → Validar → Promover → Repetir, listo para usar en Claude Code: nueve asistentes con funciones separadas, registro de cada versión, techo de costo y comando para revertir. Ninguna versión peor sustituye a la actual por decisión del sistema. El curso tiene cinco rutas y 21 lecciones para propietarios y gestores sin base técnica.

Abrir el framework LOOP-R

Hacer el curso LOOP-R

Qué cambia en cada nivel

Revisar la respuesta

El modelo critica y rehace una salida. Esto puede mejorar una tarea sin modificar sus parámetros ni su proceso de desarrollo.

Mejorar el sistema

Cambian las instrucciones, la memoria, las herramientas o el código del agente. Compara versiones con tareas reservadas y conserva la posibilidad de volver atrás.

Investigar la recursión

La mejora ayuda a producir mejoras futuras. Este mecanismo requiere evidencia: más intentos o una nota mayor no demuestran crecimiento ilimitado.

De la idea a una prueba verificable

Empieza con una tarea pequeña: responder según una política, crear preguntas a partir de un texto o extraer acciones de notas. El curso organiza este trabajo con LOOP-R, una propuesta conceptual del proyecto.

  1. Define la tarea, la referencia correcta y los límites de datos, gasto y acciones.
  2. Registra la versión inicial y separa los casos de desarrollo de los reservados para validación.
  3. Propón un cambio a la vez y compara con los mismos criterios, incluidos errores, costo y esfuerzo de revisión.
  4. Valida antes de adoptar. Conserva resultados y versiones, define quién decide y mantén una vía de reversión.

Una evaluación conocida puede explotarse. Conserva la independencia de las pruebas, comprueba los datos inventados y examina resultados fuera de la muestra. No confundas una mejora local con autonomía general.

Referencias para profundizar

Selección de la investigación del curso, consultada el 25 de septiembre de 2026. Los enlaces llevan a las publicaciones originales en inglés. Los resultados corresponden a las condiciones de los estudios; no se reprodujeron en este proyecto.

  • Self-Refine

    Generación, crítica y revisión iterativa de respuestas, sin exigir entrenamiento adicional en el procedimiento presentado.

  • Reflexion

    La retroalimentación verbal y la memoria episódica orientan intentos posteriores sin actualizar los pesos del modelo.

  • Darwin Gödel Machine

    Agentes que modifican su código y mantienen un archivo de variantes. Evidencia experimental en evaluaciones específicas.

  • AlphaEvolve · Google DeepMind

    Búsqueda de programas con evaluación automática. Las mejoras de componentes no equivalen a una medida universal de inteligencia.

  • Self-Rewarding Language Models

    El modelo participa en la generación de recompensas durante el entrenamiento iterativo. Esto difiere de pedir una crítica en una conversación.

  • Reward tampering · Anthropic

    Los experimentos sobre manipulación de recompensas destacan la necesidad de proteger el proceso de evaluación.

  • The Curse of Recursion

    Estudia la degradación bajo condiciones de entrenamiento con datos generados. No implica que todo dato sintético sea perjudicial.