← Proyectos

Arquitectura de Agentes de IA

Este es un curso que construyo en vivo, capítulo a capítulo, mientras estudio arquitectura de agentes de IA desde mi rol como Tech Lead de automatización en un banco. Vengo de 10 años de RPA/BPM/Power Platform/n8n — flujos deterministas — y este curso documenta el proceso de aprender, con datos y no con impresiones, cuándo vale la pena cederle control de flujo a un LLM y cuándo no.

Cada capítulo se publica solo cuando el anterior está completo: el Capítulo 2 no existe hasta que termine de estudiar y construir el Capítulo 1, y así con el resto. Los hallazgos, resultados de experimentos y recursos que voy encontrando en el camino los voy detallando en el blog.

Cómo leer esta guía

Tres reglas que aplican a todos los capítulos:

  1. El harness de evaluación se construye desde el Capítulo 1, no en el capítulo de evaluación. No se puede medir nada en los capítulos intermedios sin infraestructura mínima de medición. Por eso el Cap. 1 construye un harness mínimo que crece capítulo a capítulo, y recién el Cap. 7 lo formaliza.

  2. Predicción antes de correr. Antes de cada experimento registro hipótesis con números (“espero que el pipeline gane en tareas simples con ~95% vs ~80%”). La distancia entre lo que predije y lo que pasó es el material más honesto de cada capítulo.

  3. El modelo local (Qwen 2.5 7B en una RTX 3070, 8GB VRAM) es una feature pedagógica y también un confounder. Soporta tool calling, pero de forma frágil — aparecen modos de falla que un modelo frontier no comete. Por eso varios experimentos incluyen una corrida de control con un modelo mayor vía API, para separar “falla de mi arquitectura” de “falla de mi modelo”.

Ajustes a la progresión original

El orden natural sería Fundamentos → Memoria → Herramientas → Planning → Multiagente → Evaluación → Producción. Este curso hace cuatro cambios:

Los 8 capítulos, con su estado actual, están listados abajo — cada uno se activa cuando el anterior está completo y medido.

Capítulos

01

El loop de control: qué convierte a un LLM en agente

Construir un agente ReAct desde cero (sin framework) y medirlo contra un pipeline determinista para responder, con datos, cuándo ceder el control de flujo al modelo paga y cuándo no.

02

Herramientas como contrato: diseño, descripciones y límites

Próximamente

Demostrar que la calidad de un agente depende más del diseño de sus tools que de su prompt, midiendo cómo la cantidad de tools y la calidad de sus descripciones afectan la tasa de error.

03

Memoria real: del system prompt a memoria dinámica recuperable

Próximamente

Desmontar la confusión entre configuración estática y memoria construyendo memoria episódica y semántica sobre pgvector, midiendo su efecto en tareas multi-sesión.

04

LangGraph: el grafo como contrato de control

Próximamente

Migrar el loop artesanal a un grafo explícito con estado tipado, checkpoints e interrupciones, cuantificando qué da el framework y qué cobra.

05

Planning: cuándo el loop reactivo no alcanza

Próximamente

Implementar plan-and-execute y replanning, comparándolo contra ReAct puro en tareas de horizonte largo (5+ pasos).

06

Multiagente: cuándo sí, cuándo no, y cuánto cuesta de verdad

Próximamente

Resolver el mismo problema con un single-agent bien equipado y con una topología supervisor-workers, cuantificando el sobrecosto real.

07

Evaluación sistemática: convertir el harness en infraestructura

Próximamente

Formalizar la evaluación de trayectorias, LLM-as-judge con validación humana, suites de regresión y detección de degradación al cambiar modelo o prompt.

08

Producción en banca regulada: auditabilidad como arquitectura

Próximamente

Trazabilidad completa de decisiones, human-in-the-loop con interrupciones persistentes, control de acceso por identidad/rol, y presupuestos de costo.