No es un chatbot con acceso a tus logs. Es una cadena de agentes especializados, construida sobre Google ADK, que analiza, correlaciona y propone acciones concretas frente a un incidente — con un humano en el loop cuando la decisión importa.
Cada etapa del triage la resuelve un agente especializado, con handoffs estructurados entre uno y otro — no es un único modelo tratando de hacer todo a la vez.
Recibe la alerta, clasifica severidad y determina qué servicio está afectado.
Un agente revisa logs (vía BigQuery) mientras otro analiza telemetría del host por SSH — en simultáneo, no en secuencia.
Cruza ambos análisis contra el catálogo de topología de servicios para identificar la causa raíz con contexto real de tu arquitectura.
Busca el runbook de Ansible que mejor matchea el diagnóstico, dentro de una librería con flags de autonomía configurables.
Ejecuta la acción sugerida — o espera aprobación humana, según el nivel de autonomía que definas para ese servicio.
El diferencial no es el modelo de lenguaje — es el contexto. El agente entiende cómo están conectados tus servicios antes de sugerir una acción.