Con una cuenta desbloqueas el cuestionario, el foro de dudas y el tutor con IA de esta lección, además del registro de progreso y el certificado verificable al terminar «IA Agéntica: Agentes que Operan Sistemas Reales».
Un solo prompt produce una respuesta. ReAct (reasoning and acting) produce una trayectoria: el modelo alterna explícitamente entre razonar sobre lo que sabe, actuar con una herramienta y observar el resultado, y esa observación condiciona el siguiente razonamiento. Lo que ReAct añade sobre un prompt único no es "más inteligencia": es contacto con la realidad en mitad del razonamiento. Un prompt único que responde "el rotor está bloqueado" está adivinando; una trayectoria ReAct que lee la telemetría y luego concluye lo mismo está fundamentada.
El coste de esa ventaja es no determinismo. La misma pregunta puede producir trayectorias distintas, y una de ellas puede ser un bucle: llamar la misma herramienta con los mismos argumentos esperando un resultado diferente. Por eso el patrón nunca se despliega desnudo, sino dentro de límites explícitos.
Descomposición de tareas
Antes de elegir arquitectura conviene descomponer. "Prepara el informe semanal de la estación" no es una tarea: son cinco (recolectar pases, cruzar con grabaciones, calcular tasa de éxito, detectar anomalías, redactar). La descomposición es útil porque revela algo decisivo: casi siempre, la mayoría de los subpasos son deterministas. Calcular una tasa de éxito no requiere juicio; detectar qué anomalía merece mención sí.
El espectro de control
Entre "agente libre" y "código" no hay dos opciones sino un continuo:
Código puro: sin modelo. Máximo determinismo, cero adaptabilidad.
Workflow determinista con pasos agénticos: el grafo de ejecución lo fijas tú; el modelo decide solo dentro de nodos concretos. Reproducible, presupuestable, depurable.
Agente con plan revisable: el modelo propone un plan, se valida contra un catálogo de acciones permitidas y se ejecuta con posibilidad de replanificar.
Agente libre: el modelo decide cada paso sin estructura impuesta. Máxima adaptabilidad, mínima previsibilidad.
El criterio de elección es directo: ¿conoces el camino? Si el proceso es repetible y lo has hecho veinte veces, es un workflow, aunque algunos nodos necesiten juicio. Si el camino depende de lo que encuentres, es exploración y necesita agente. El error caro es usar el nivel 4 para procesos que llevaban años siendo el nivel 2 — se paga en coste, latencia y en la incapacidad de explicar por qué hoy hizo algo distinto que ayer.
Ejemplo resuelto: literatura → borrador, medido
Compara dos diseños para "revisar la literatura sobre enlaces ópticos y producir un borrador".
Diseño A, agente libre. Sin estructura, el episodio consume 22 iteraciones. Con Δ=1850 tokens por iteración (lección 1):
TA=22×1850=40700 tokens
Diseño B, workflow con pasos agénticos. Cinco etapas fijas: (1) construir consultas, (2) buscar, (3) filtrar por criterios, (4) sintetizar, (5) redactar. Las etapas 2 y 3 son código determinista; solo 1, 4 y 5 son agénticas, con un presupuesto de ≤3 iteraciones cada una, es decir ≤9 iteraciones:
TB=9×1850=16650 tokens
La razón es TA/TB=40700/16650≈2.44: el agente libre cuesta unas 2.4 veces más. Pero el argumento decisivo no es el coste sino la varianza: el diseño B tiene un techo duro de 9 iteraciones y siempre ejecuta las mismas cinco etapas, así que cuando falla sabes en qué etapa falló. El diseño A puede costar 12 iteraciones un día y 40 al siguiente, y su fallo es un texto largo sin punto de anclaje. Reserva el agente libre para cuando el camino sea genuinamente desconocido.
Presupuestos: los límites son un mecanismo de seguridad
Todo agente en producción corre con tres presupuestos explícitos, y todos son de seguridad antes que de coste:
Pasos: número máximo de iteraciones del lazo (típicamente 8–15). Corta bucles.
Tokens: techo acumulado por episodio. Corta la degradación silenciosa por contexto saturado.
Tiempo (de pared): límite total del episodio. Corta esperas indefinidas por un sistema externo caído.
Agotar un presupuesto no es un error a esconder: es una terminación legítima que debe reportarse como tal, con el estado parcial alcanzado. Un agente que se queda sin pasos y responde igualmente con una conclusión inventada es peor que uno que dice "agoté 12 pasos, esto es lo que verifiqué y esto es lo que falta". La honestidad operativa es un requisito de diseño, y volveremos a ella en la lección 8.
Reintentos, idempotencia y fallos parciales
Los planes fallan a mitad de camino. La estación responde con un 503 en el paso 4 de 6, y los pasos 1 a 3 ya modificaron estado. Tres reglas para ese mundo:
Primera: todo paso re-ejecutable debe ser idempotente. Sin idempotencia, reintentar es duplicar. Con ella, reintentar es gratis. Es la misma propiedad de la lección 2, ahora aplicada al plan completo.
Segunda: cuantifica el reintento. Si un paso tiene probabilidad de éxito p=0.8 por intento y los fallos son independientes, la probabilidad de éxito tras k=3 intentos es:
P(eˊxito en≤3)=1−(1−p)k=1−0.23=1−0.008=0.992
Es decir, del 80% al 99.2% con dos reintentos. Pero la hipótesis de independencia es la que hay que vigilar: si el fallo se debe a que el rotor está mecánicamente bloqueado, p no es 0.8 sino 0, y los tres intentos fallan con certeza. Reintentar sirve para fallos transitorios; ante un fallo persistente, reintentar solo consume presupuesto y retrasa la escalada. De ahí la regla práctica: backoff exponencial y un número pequeño de intentos, más una condición de abandono.
Tercera: define la política de fallo parcial por adelantado. Las opciones son compensar (deshacer lo hecho), continuar en modo degradado o detenerse y escalar. Elegir en caliente, sin política previa, es como se producen los estados inconsistentes.
Comprueba el criterio de elección de arquitectura:
Un proceso de cierre mensual se ejecuta igual desde hace dos años, con un único punto donde hace falta juicio (clasificar incidencias atípicas). ¿Qué diseño corresponde?
1 de 6
Hasta aquí hemos razonado siempre sobre un agente. En la lección 6 preguntaremos qué cambia cuando el trabajo se reparte entre varios: qué se gana en paralelismo y verificación independiente, y qué se paga en coordinación.