Con una cuenta desbloqueas el cuestionario, el foro de dudas y el tutor con IA de esta lección, además del registro de progreso y el certificado verificable al terminar «IA Agéntica: Agentes que Operan Sistemas Reales».
La ventana de contexto es un presupuesto, no un almacén
Todo lo que el modelo "sabe" en un instante dado cabe en su ventana de contexto: instrucciones del sistema, definiciones de herramientas, historial de la conversación, resultados de tools y documentos inyectados. Es un recurso finito, se paga en cada llamada y compite consigo mismo — cada token de catálogo es un token menos de trabajo. Tratarla como un almacén ("le meto todo por si acaso") produce agentes caros, lentos y, contra la intuición, menos precisos: la información relevante se diluye entre ruido.
Ejemplo resuelto: presupuesto de una llamada
Retomamos el agente de la lección 1: ventana C=128000 tokens, reserva de salida R=8000, luego entrada útil Cutil=120000. Su contexto fijo se compone así:
Componente
Tokens
Instrucciones del sistema y políticas
1 200
12 definiciones de herramientas (12×180)
2 160
Historial de la sesión
6 400
8 fragmentos recuperados (8×700)
5 600
Total ocupado
15 360
Queda entonces 120000−15360=104640 tokens para el trabajo del lazo. A Δ=1850 tokens por iteración:
N=⌊1850104640⌋=⌊56.6⌋=56 iteraciones
Ahora observa la sensibilidad: si en lugar de 8 fragmentos inyectas 40, el bloque recuperado pasa de 5600 a 28000 tokens, el espacio de trabajo cae a 82240 y las iteraciones a ⌊44.4⌋=44. Has perdido 12 iteraciones — más del 20 % de la capacidad de razonamiento del agente — a cambio de 32 fragmentos que probablemente nadie leerá. Recuperar más no es recuperar mejor.
Tres memorias, tres ciclos de vida
Memoria de turno: lo que existe dentro de una sola llamada al modelo. Se pierde al terminar. Es la más barata y la más volátil.
Memoria de sesión: el historial del episodio agéntico completo, que crece con cada iteración. Cuando amenaza con desbordar se resume o se poda — y toda poda es una decisión de diseño con consecuencias: lo podado deja de existir para el agente.
Memoria persistente: hechos que sobreviven entre sesiones (preferencias del operador, configuración de la estación, incidentes previos). Vive en una base de datos, no en el contexto, y se recupera selectivamente cuando hace falta.
La confusión entre las tres produce dos patologías simétricas: agentes con amnesia, que vuelven a preguntar lo que ya se les dijo; y agentes con memoria hipertrofiada, que arrastran contexto irrelevante de hace tres semanas y lo tratan como vigente.
RAG en cuatro pasos
La recuperación aumentada de generación (RAG, retrieval-augmented generation) es el mecanismo estándar para llevar conocimiento externo al contexto. El curso de Inteligencia Artificial cubre la parte de vectores y similitud; aquí nos interesa solo el flujo operativo:
Trocear: partir los documentos en fragmentos con solape, para que ninguna idea quede cortada por la mitad.
Indexar: calcular una representación de cada fragmento y guardarla con su procedencia.
Recuperar: ante una consulta, traer los k fragmentos más relevantes.
Inyectar: colocarlos en el contexto, marcados como material recuperado y con su fuente.
Ejemplo resuelto: cuántos fragmentos produce un manual
Un manual de operación de 42000 palabras se trocea en fragmentos de L=500 palabras con solape s=100. El paso efectivo entre fragmentos es L−s=400 palabras, así que:
n=⌈40042000−100⌉=⌈104.75⌉=105 fragmentos
Comprobación: el fragmento 105 empieza en la palabra 104×400=41600 y cubre hasta la 42100, es decir, más allá del final del documento. Con 104 fragmentos el último terminaría en 41700 y quedarían 300 palabras sin indexar. El solape cuesta: se almacenan 105×500=52500 palabras para un documento de 42000, un 25 % de redundancia que se paga para no partir ideas por la mitad.
Grounding: separar lo sabido de lo inyectado
Grounding es anclar la respuesta del modelo en material verificable presente en el contexto, en lugar de en sus parámetros. Un agente de operaciones que afirma "el rotor se calibró el martes" debe poder señalar de dónde salió esa afirmación: de un registro que se le inyectó, no de su intuición estadística.
La implementación práctica es la traza de grounding, el patrón que usamos en el copiloto de lab-suite: junto a la respuesta, el sistema expone qué se inyectó, de qué fuente, cuánto pesó en tokens y qué fragmento respalda cada afirmación. Su valor es doble. Para el usuario, convierte una respuesta opaca en una auditable. Para el ingeniero, hace depurable el fallo: cuando el copiloto se equivoca, la traza dice inmediatamente si el error fue de recuperación (no se le dio el dato) o de razonamiento (se le dio y lo interpretó mal). Sin traza, ambos fallos se ven idénticos desde fuera y se "arreglan" tocando el prompt al azar.
Alucinaciones y su mitigación
Un LLM optimiza la plausibilidad de la continuación, no su veracidad. La alucinación no es un defecto que se elimina con un parche: es el modo de fallo natural del mecanismo cuando falta el dato. Por eso las mitigaciones que funcionan son arquitectónicas, no de redacción:
Citas verificables: toda afirmación factual apunta a un fragmento inyectado. Si no hay fragmento, no hay afirmación.
"No lo sé" como respuesta legítima y premiada: si el sistema penaliza implícitamente la abstención, obtendrá invención.
Verificación posterior con herramientas: antes de reportar "el pase se programó", el agente llama a ver_pases y lo comprueba. Ejecutar la acción y comprobar el efecto son dos cosas distintas.
Separación explícita de roles en el contexto: lo recuperado se marca como dato externo, no como instrucción — punto que en la lección 7 resultará ser también una defensa de seguridad.
La frontera público/privado
En el gemelo digital ATP-DT el copiloto vive con dos mundos de contexto: el del clúster (documentación de arquitectura, ADRs, catálogos públicos) y el de la organización (datos de operación, identidades, configuraciones). El diseño obliga a declarar, para cada fuente, de qué lado de la frontera está, y prohíbe que material del lado privado se filtre a respuestas del lado público. La regla no se cumple con buenas intenciones en el prompt: se cumple filtrando en la capa de recuperación, antes de que el fragmento llegue al contexto. Lo que nunca se inyecta no puede filtrarse.
1 de 6
Comprueba el criterio de mitigación:
Un copiloto de operaciones afirma que un pase se programó, pero no se programó. ¿Cuál es la mitigación correcta?
Con el contexto bajo control, la siguiente pregunta es de plomería: cómo conectar un agente a media docena de sistemas sin escribir media docena de integraciones a medida. Esa es la lección 4.