Quando um switch cai e você recebe quarenta notificações, o problema não é o switch: é a falta de dependência entre gatilhos. Veja como organizar isso.
Tempestade de alerta acontece quando um único incidente dispara dezenas de notificações independentes. O time perde tempo lendo ruído e, pior, começa a ignorar alerta — que é exatamente o oposto do objetivo do monitoramento.
1. Mapeie a dependência física
Se todos os servidores de um rack passam por um switch, a queda desse switch deve suprimir os alertas dos servidores. No Zabbix isso é feito com dependência de gatilho: o gatilho "servidor inacessível" depende do gatilho "switch inacessível".
2. Use itens dependentes
Em vez de fazer três coletas separadas para extrair três valores do mesmo retorno, colete uma vez e derive o resto com pré-processamento. Menos requisição, menos carga e menos ponto de falha.
3. Cadastre manutenção antes da janela
Toda atualização planejada deve ter período de manutenção cadastrado. É um minuto de trabalho que evita meia hora de mensagem inútil no grupo do plantão.
4. Revise severidade periodicamente
Gatilho que dispara toda semana e nunca gera ação está com severidade errada ou não deveria existir. Faça uma revisão mensal dos dez alertas mais frequentes e decida: corrigir a causa, ajustar o limite ou remover.
5. Escalone em vez de repetir
Repetir a mesma mensagem a cada cinco minutos não aumenta a chance de resolução. Escalone: primeiro o plantão, depois o coordenador, depois o gestor. Cada nível com intervalo maior.
Monitoramento maduro se mede pela relevância do alerta, não pela quantidade.