Planificación de agentes de IA: objetivos, pasos y parada
La planificación de un agente de IA selecciona pasos y los revisa cuando aparecen observaciones nuevas. Un plan útil conecta cada paso con un resultado, requisitos previos y comprobación. Planificar propone el recorrido; los controles de ejecución determinan qué acciones se permiten y cuándo debe detenerse el sistema.

Una lista larga puede parecer convincente y ocultar una entrada ausente. Esta guía vuelve comprobable el plan. Diseñaremos una ruta a una lección introductoria y la revisaremos cuando el catálogo revele un requisito no satisfecho.
Ideas principales
- Define el resultado antes de enumerar acciones.
- Revisa el plan cuando cambia la evidencia.
- Vincula cada paso completado a una observación.
- Agotar el presupuesto significa detenerse, no terminar con éxito.
Define un resultado comprobable
'Aprender IA' es demasiado amplio para saber cuándo terminar. 'Encontrar una lección introductoria autorizada y devolver su requisito' permite una comprobación. Registra fuente de entrada, operaciones permitidas y salida aceptable. Si el objetivo está confuso, añade una aclaración en lugar de buscar todas las materias. El resultado debería decir qué se encontró y qué falta. Esa definición ofrece al sistema una condición de finalización y a la persona un criterio para revisar su trabajo.
Vincula pasos con resultados
'Buscar' nombra una acción, pero no explica su utilidad. Escribe 'recuperar un registro de lección para la materia elegida' y especifica la evidencia esperada. La comprobación de requisitos depende de que el registro exista. Así haces visibles las dependencias. Un plan explícito puede detenerse ante un dato ausente, en vez de continuar con una recomendación sin apoyo porque quedan elementos en la lista. Ejecutar una llamada no equivale automáticamente a avanzar hacia el objetivo.
Revisa según lo que ocurrió
El ciclo compara observaciones con supuestos. Si la lección es avanzada, busca la introducción requerida o indica que falta en el catálogo permitido. Si falla la consulta, conserva el fallo separado de una búsqueda vacía. ReAct es un ejemplo de investigación que combina decisiones, acciones y observaciones. Para este ejercicio, el hábito importante es utilizar nueva evidencia para modificar el siguiente paso y guardar la razón del cambio, aunque el plan inicial pareciera convincente.
Diseña condiciones de parada
Distingue éxito, imposibilidad de completar, espera de revisión y límite de ejecución. En Python, un presupuesto de pasos evita propuestas indefinidas. Una aplicación real también puede limitar tiempo, llamadas y uso. Configura los límites en el controlador, sin depender de que el modelo los recuerde. Al alcanzarlos, devuelve lo conocido y lo pendiente sin declarar completado el objetivo. Un estado preciso permite decidir cómo continuar según el progreso real y la información disponible.
Evalúa plan y resultado final
Comprueba si los pasos estaban permitidos y si produjeron la salida pedida. Un plan bien formateado puede recomendar una lección ajena al catálogo. Guarda objetivo, identificadores, pasos completados y verificación final en una nota breve. Si intervienen varios agentes, distingue una subtarea acabada de una entrega pendiente. Revisa fallos para decidir si deben cambiar objetivo, herramientas o transiciones. La evaluación debe conectar el dato inicial con la evidencia de un resultado aceptable.
En palabras sencillas
El plan es una ruta en un mapa. Las observaciones dicen si la carretera está abierta. Un buen planificador revisa el camino con la evidencia, mientras el controlador mantiene los límites y determina cuándo parar.
Pruébalo
Planifica una recomendación en cuatro pasos. Añade ramas de registro ausente y lección avanzada. Define una observación por paso y un presupuesto educativo de tres consultas.
Resultado esperado
Un plan con dependencias, resultados pendientes honestos y parada al llegar al presupuesto establecido.
Comprueba tu respuesta: ¿Una llamada correcta significa tarea terminada?
Solo si su resultado satisface el criterio original. Puede devolver correctamente un registro irrelevante o incompleto.
Preguntas y respuestas
¿El agente debe seguir el primer plan exactamente?
El plan guía el trabajo, pero debe poder revisarse. Nuevas observaciones pueden revelar requisitos ausentes o supuestos incorrectos. Conserva objetivo y restricciones, explica el cambio y comprueba el nuevo camino. Seguir ciegamente el primer plan puede propagar un error inicial.
¿Cómo detengo acciones repetidas?
Define presupuesto y seguimiento de acciones en el controlador. Decide qué ocurre cuando una consulta idéntica no aporta información: parar, aclarar o elegir una alternativa autorizada. Prueba esa política. Un prompt que pide evitar repeticiones no sustituye el límite de ejecución.
Explica cada paso mediante resultado y evidencia. Un plan útil puede revisar, pausar y terminar sin presentar un límite como éxito.
Fuentes y lecturas
- Yao et al. — ReAct: Synergizing Reasoning and Acting in Language Models ↗Fuentes revisadas:
- Anthropic — Building effective agents ↗Fuentes revisadas:
- LangChain — LangGraph overview ↗Fuentes revisadas: