Cuando empezamos con Sofía, la pregunta no era "¿puede un agente responder correos?" sino "¿podemos mantener en producción un agente que toma decisiones sobre 20 sistemas internos sin perder trazabilidad?". La respuesta corta: sí, si construís el grafo de decisiones vos.
Por qué LangGraph
El loop tradicional de tool-use (modelo decide → ejecuta tool → modelo lee resultado → repite) se vuelve frágil cuando hay muchas herramientas con prerequisitos. LangGraph permite modelar el agente como un grafo de estados explícito: cada nodo es una decisión auditada, cada transición está validada.
Distribución por tipo de gestión en el último mes.
Observabilidad
Cada ejecución del agente queda registrada en LangSmith con el grafo recorrido, los inputs y outputs de cada tool, latencia y costo en tokens. Cuando una respuesta falla, no es magia: hay un trace que muestra exactamente en qué nodo el agente tomó la decisión equivocada y por qué.
Mejora luego de cachear lookups frecuentes en el nodo de contexto.
El verdadero diferencial no fue elegir un framework: fue tratar al agente como software de misión crítica, con tests, observabilidad y review humano sobre las decisiones de mayor impacto.
Sofía hoy procesa miles de correos por mes, escala una fracción a operadores humanos con todo el contexto resumido, y libera al equipo de atención para que se concentre en los casos que realmente requieren criterio humano.