Warum Monitoring?
Probleme erkennen, bevor sie zum Ausfall werden.
- Verfügbarkeit und Leistung sichern
- Trends und Kapazität planen
- Fehler schneller eingrenzen
Monitoring vs. Observability
Monitoring
Bekannte Metriken überwachen („ist X ok?“).
Observability
Aus Daten unbekannte Probleme verstehen („warum?“).
- Monitoring beantwortet erwartete Fragen
- Observability hilft bei Unerwartetem
Die drei Säulen
Metriken, Logs und Traces ergeben zusammen das Gesamtbild.
- Metriken: Zahlen über die Zeit
- Logs: Ereignisse im Detail
- Traces: Weg einer Anfrage durch Systeme
Alert-Fatigue vermeiden
Zu viele Alarme sind so schädlich wie zu wenige – wichtige gehen unter.
- Sinnvolle Schwellwerte statt Rauschen
- Alarme priorisieren und gruppieren
- Eskalationswege definieren
- Regelmäßig aufräumen
SLA, SLO & Fehlerbudget
Ein Fehlerbudget macht Verfügbarkeit messbar: erlaubte Ausfallzeit vor Konsequenzen.
- SLA ist die Zusage, SLO das interne Ziel
- Verfügbarkeit sauber messen und berichten
- Fehlerbudget steuert das Tempo von Änderungen