# Observabilidad y trazabilidad de agentes de IA: ver qué hace el sistema

> Trazabilidad de agentes de IA: trazas por caso, métricas operativas y alertas de degradación para saber qué hace un sistema de agentes mientras opera.

- Canonical: https://arkatai.com/observabilidad-y-trazabilidad-de-agentes/
- Site: Arkatai (https://arkatai.com) — agentic operations as a service
- Language: es
- Published: 2026-07-19

---


La observabilidad de un sistema de agentes es la capacidad de ver qué está haciendo mientras opera: una traza por cada caso, métricas operativas en vivo (volumen, latencia, coste por caso, tasa de escalado) y alertas que saltan cuando algo se degrada. Sin ella, un agente en producción es una caja negra que trabaja rápido y no sabes si trabaja bien hasta que un cliente se queja. Es la diferencia entre operar un sistema y confiar en que funcione.

Lo aprendí operando estos sistemas, no leyéndolo. Un agente puede procesar mil casos por hora con una calidad impecable durante semanas y empezar a fallar un martes cualquiera porque cambió un formato de entrada aguas arriba. Si estás mirando, lo ves en la primera desviación y actúas. Si no, lo descubres en la reclamación número cuarenta. La observabilidad es lo que te da la primera opción.

## Qué significa observar un sistema de agentes

Observar es responder, en cualquier momento, a tres preguntas: qué está pasando ahora, qué pasó con un caso concreto, y va todo dentro de lo normal. Cada una necesita un tipo de información distinto.

Esto es diferente de la [evaluación de agentes de IA](/evaluacion-de-agentes-de-ia/), que mide la calidad contra casos de respuesta conocida, casi siempre antes de producción. La evaluación te dice si el agente es bueno en un banco de pruebas; la observabilidad te dice qué está haciendo con el tráfico real, ahora, en tu operación. Un agente puede aprobar la evaluación y degradarse en producción por un cambio que la prueba no contemplaba. Por eso las dos son necesarias, y por eso los fallos que ves observando se convierten en casos nuevos para volver a evaluar.

## La traza por caso

La unidad básica es la traza: el registro de qué hizo el agente en un caso, paso a paso. Para un agente que resuelve una incidencia de pedido, una traza útil recoge qué recibió (el correo del cliente, el estado en el ERP), qué reglas aplicó, qué consultó, qué decidió y qué acción ejecutó o a quién escaló. Reconstruida, cualquiera puede seguir el razonamiento sin haber estado delante.

La traza sirve para dos cosas que conviene no mezclar. En caliente, es la herramienta de diagnóstico: cuando un caso sale raro, abres su traza y ves dónde se torció. En frío, es la base de la evidencia. Pero registrar para operar y registrar para demostrar ante un tercero no son el mismo trabajo. La evidencia formal, con integridad garantizada y pensada para una auditoría o un regulador, la trato en [auditar decisiones de agentes](/auditar-decisiones-de-agentes/). La observabilidad se queda en el lado operativo: ver para corregir, no para probar en un juicio.

## Las métricas operativas

Por encima del caso individual están las métricas agregadas, que son las que miras en un panel a diario. Estas cuatro son las que no me falta ninguna:

| Métrica | Qué te dice | Qué delata cuando se mueve |
|---|---|---|
| Volumen | Cuántos casos procesa el sistema por unidad de tiempo | Una caída puede indicar un atasco aguas arriba o una integración caída |
| Latencia | Cuánto tarda en resolver un caso | Un pico avisa de un cuello de botella o de un modelo respondiendo lento |
| Coste por caso | Cuánto cuesta cada caso resuelto | Una subida sin más volumen indica reintentos, casos que se complican o un modelo más caro |
| Tasa de escalado | Qué proporción de casos manda a una persona | Una subida repentina es la señal más clara de que algo se ha degradado |

La tasa de escalado merece una mención aparte porque es el mejor termómetro que conozco. Si de golpe el agente empieza a escalar el doble, algo ha cambiado: un tipo de caso nuevo, un dato que llega distinto, un modelo que decide peor. No siempre sabes qué al instante, pero sabes que hay que mirar. Un sistema que escala más de lo normal te está pidiendo atención antes de que el problema llegue al cliente.

## Alertas de degradación

Mirar paneles a mano no escala. La observabilidad seria define umbrales y avisa sola cuando se cruzan: la latencia se dispara, el coste por caso sube sin razón, la tasa de escalado se sale de su banda, el volumen cae a cero. La alerta no arregla nada, pero convierte un problema silencioso en uno visible, que es la mitad de la solución.

El objetivo no es la perfección, es el tiempo de reacción. Un sistema de agentes bien operado también falla. La diferencia con uno mal operado es que en el primero te enteras tú antes que el cliente. Por eso cuando un comité me pregunta por el riesgo de poner agentes en producción, mi respuesta empieza por aquí: el riesgo no se elimina, se hace visible y se acota. Un agente con permisos amplios y sin observabilidad es la combinación que no debería aprobar ningún consejo. El marco de control completo está en [gobernanza de agentes](/gobernanza-de-agentes/), y los límites de acción del propio agente, en [permisos y controles de agentes](/permisos-y-controles-de-agentes/).

## Dónde encaja en el sistema completo

La observabilidad no es un añadido que se atornilla al final. Se diseña con el agente, porque depende de que cada paso deje rastro: un sistema que no fue construido para dejar traza no se puede observar después sin rehacerlo. Forma parte de la [arquitectura de agentes de IA](/arquitectura-de-agentes-de-ia/) desde el primer trazo, igual que las evaluaciones y el escalado.

En el ciclo con el que trabajamos en Arkatai —mapear, desplegar, operar y actualizar—, la observabilidad es lo que hace posible la fase de operar con cabeza: empezar con revisión humana intensa y ir relajando el control solo donde los datos, vistos en el panel, demuestren fiabilidad sostenida. Sin ese panel no hay datos, y sin datos la decisión de dar más autonomía a un agente se toma a ciegas. Cómo evoluciona esa confianza la desarrollo en [human in the loop](/human-in-the-loop/).

Y es también lo que sostiene la promesa de una operación gestionada frente a un producto que instalas y mantienes tú. Cuando el proveedor opera el sistema, la observabilidad es lo que le permite responder por el resultado: no «te vendí el software», sino «veo lo que hace, lo corrijo cuando se desvía y respondo por ello». Ese es el modelo que argumento en [agentes de IA para empresas](/agentes-de-ia-para-empresas/).

Si un proveedor no te enseña cómo observa el sistema que va a operar para ti, esa es la pregunta que yo haría antes de firmar. No «cómo de bueno es el agente», sino «enséñame el panel». Lo que ve —o no ve— mientras el sistema trabaja te dice más que cualquier demo.

## Preguntas frecuentes

### ¿Qué es la observabilidad de agentes de IA?

Es la capacidad de ver qué hace un sistema de agentes mientras opera: una traza por cada caso, métricas operativas en vivo como volumen, latencia, coste por caso y tasa de escalado, y alertas que avisan cuando algo se degrada. Su objetivo es que te enteres tú de un problema antes de que llegue al cliente.

### ¿Qué diferencia hay entre observabilidad y trazabilidad?

La trazabilidad es el registro paso a paso de cada caso: qué recibió el agente, qué reglas aplicó y qué hizo. La observabilidad es el uso operativo de esas trazas más las métricas agregadas para vigilar el sistema en vivo. La traza es el dato. La observabilidad es mirarlo para operar.

### ¿En qué se diferencia la observabilidad de la auditoría?

La observabilidad sirve para ver y corregir el sistema mientras trabaja, en caliente. La auditoría reconstruye a posteriori qué decidió el agente y por qué, como evidencia formal ante un tercero, con integridad garantizada. Usan la misma traza, pero una mira el presente para actuar y la otra el pasado para demostrar.

### ¿Qué métricas debo vigilar en un agente en producción?

Volumen, latencia, coste por caso y tasa de escalado como base. La tasa de escalado es el mejor termómetro de degradación: si sube de golpe, algo ha cambiado aunque todavía no sepas qué. Conviene definir umbrales en cada una y configurar alertas automáticas para no depender de mirar el panel a mano.