Architectural Decision Story · ADS-05
Observability by Design
Como logs, métricas e traces ajudam a construir sistemas confiáveis?
Contexto
Sistemas com filas, integrações externas e componentes de IA falham de formas parciais: um webhook atrasado, uma dependência lenta, uma resposta de modelo degradada.
Problema
Instrumentar depois do primeiro incidente significa descobrir problemas pelo cliente e investigar sem dados.
Alternativas consideradas
- Logs ad hoc
- Prototipação.
- Sinais definidos no desenho
- Qualquer sistema em produção: SLOs, métricas de negócio, logs estruturados e correlação entre etapas.
- Monitoramento apenas de infraestrutura
- Insuficiente sozinho: CPU saudável não garante pedido entregue.
Trade-offs
- Custo de instrumentação e armazenamento versus tempo de diagnóstico.
- Alertas demais geram fadiga; alertar só na mudança de estado preserva atenção.
Decisão
Definir os sinais junto com a funcionalidade: o que significa “funcionando”, como medir, quem é avisado e quando.
Consequências
- Cada fluxo crítico tem um indicador que o time entende.
- Avaliação de qualidade de IA entra na mesma disciplina de observabilidade.
Aprendizados
- Observabilidade é uma pergunta de produto antes de ser uma ferramenta.