7.10 · INFRAESTRUTURA E CLOUD

Observabilidade ajuda a explicar sistemas quando algo deixa de ser previsível.

Dados de execução conectam sintomas à causa e tornam incidentes uma fonte de melhoria, não apenas de urgência.

TRÊS SINAIS COMPLEMENTARES

Logs, métricas e traces respondem perguntas diferentes.

Uma tela lenta pode ser percebida por uma métrica; um trace mostra por quais serviços a requisição passou; logs estruturados ajudam a investigar um evento específico. Nenhum dos três substitui os demais.

Logs

Eventos detalhados e contextualizados: o que ocorreu, quando e com qual correlação.

Métricas

Séries numéricas para acompanhar taxa, erro, duração, saturação e capacidade.

Tracing

Rastro distribuído de uma requisição por serviços, filas, banco e dependências.

PRÁTICA COM CONTEXTO

Projete os sinais antes do incidente.

  1. Defina a jornada crítica. Por exemplo: login, busca, checkout ou envio de atividade.
  2. Adicione um identificador de correlação. Ele conecta logs e spans sem registrar dados sensíveis.
  3. Meça serviço e experiência. Taxa de erro, duração e disponibilidade devem conversar com o impacto real.
  4. Crie alertas acionáveis. Todo alerta deve indicar quem age, em quanto tempo e onde encontrar contexto.
{
  "level": "info",
  "event": "pedido.criado",
  "request_id": "req_8f2a",
  "pedido_id": "ord_1042",
  "duration_ms": 84
}

DECISÕES RESPONSÁVEIS

Incidentes são uma oportunidade de restaurar e aprender.

Evite registrar senhas, tokens ou dados pessoais em logs. Observabilidade precisa de contexto suficiente para diagnosticar, mas deve respeitar privacidade, retenção e controle de acesso.
PerguntaPor que importa
O serviço está degradado?Métricas mostram, por exemplo, latência p95 e taxa de erros.
Onde a requisição demorou?Um trace revela a contribuição de cada dependência no tempo total.
O que aconteceu neste caso?Logs estruturados, com request_id, ajudam a investigar o evento específico.