Die 24 Monitor-Agenten decken den kompletten Beobachtungs-Zyklus ab: Sie legen fest, was ein Dienst überhaupt messen soll (Golden Signals), instrumentieren Code mit benannten Metriken und Kardinalitäts-Budget, entwerfen strukturierte Log-Schemata mit Korrelations-IDs und binden Trace-Context über Dienstgrenzen hinweg ein. Jeder Agent arbeitet nach einem festen Output-Vertrag — du bekommst Tabellen, Konfigurationen und Queries statt vager Ratschläge.
Auf der Betriebsseite formulieren sie messbare SLOs mit PromQL-Queries und Fehlerbudget-Berechnung, schreiben Alert-Regeln mit Schweregraden und Runbook-Verweisen, trennen bei Alarm-Müdigkeit Signal von Rauschen und rekonstruieren nach einem Vorfall die Zeitleiste inklusive Erkennungs- und Behebungsdauer. Auch die Kostenfrage ist abgedeckt: Kardinalitäts-Kontrolle, Retention-Tiering für Logs und Metriken sowie ein Audit des gesamten Observability-Stacks mit priorisierter Einsparungs-Roadmap.
Typische Aufgaben
- Ein neuer Dienst geht ohne Beobachtungskonzept live — kv-monitor-golden-signals legt fest, was gemessen wird, kv-monitor-metrics-instrumentation liefert den Instrumentierungs-Patch dazu.
- Ein Vertrag nennt ein Verfügbarkeitsziel ohne Messlogik — kv-monitor-slo-definition schreibt SLIs, PromQL-Queries und Fehlerbudget, kv-monitor-error-budget-policy die Konsequenzen bei Verbrauch.
- Der Pager klingelt nachts im Minutentakt — kv-monitor-alert-noise-reduction leitet Gruppierungs- und Inhibitionsregeln ab, kv-monitor-oncall-routing prüft, wer wann alarmiert wird.
- Nach dem Ausfall fehlt die Chronik — kv-monitor-incident-timeline korreliert Alarme, Deploy-Marker und Eingriffe zu einer Zeitleiste mit Erkennungs- und Behebungsdauer.
Alle 24 Agenten in kv-monitor
Jede Zeile ist eine Datei im ausgelieferten Paket — Name identisch mit dem Ordner im Download.
-
kv-monitor-alert-noise-reductionErstellt bei Alarm-Müdigkeit einen Lärmreduktions-Bericht mit Gruppierungs-, Inhibitions- und Routing-Regeln. -
kv-monitor-alert-rule-authorErstellt Alert-Regel-Sets mit Ausdrücken, Schweregraden und Runbook-Verweisen für unüberwachte Fehlerfälle. -
kv-monitor-anomaly-baselineErstellt Baseline-Modelle mit saisonalen Mustern und dynamischen Bändern, wo feste Schwellenwerte versagen. -
kv-monitor-cardinality-controlPrüft explodierende Label-Kombinationen und liefert einen Audit-Bericht mit Drop- und Aggregations-Regeln. -
kv-monitor-dashboard-builderErstellt versioniertes Dashboard-JSON nach RED/USE-Methode mit Variablen und Beschreibungstexten. -
kv-monitor-dependency-health-mapKartiert Service-Abhängigkeiten mit kritischen Pfaden, Ausfallradius und Beobachtungs-Lücken. -
kv-monitor-distributed-trace-analysisAnalysiert vorhandene Traces per Span-Wasserfall und liefert kritischen Pfad plus Latenz-Hotspot-Liste. -
kv-monitor-error-budget-policyErstellt Fehlerbudget-Richtlinien mit Verbrauchsschwellen, Burn-Rate-Alarmen und Eskalationsstufen. -
kv-monitor-golden-signalsLegt fest, was ein Dienst messen soll — Golden-Signals-Spezifikation mit Metrik-Quellen und Schwellen. -
kv-monitor-healthcheck-designEntwirft Healthcheck-Spezifikationen mit getrennten Liveness-, Readiness- und Startup-Sonden samt Timeouts. -
kv-monitor-incident-timelineRekonstruiert Vorfall-Chroniken mit Deploy-Markern, Alarm-Zeitstempeln sowie Erkennungs- und Behebungsdauer. -
kv-monitor-latency-percentile-analysisAnalysiert Tail-Latenz per p50/p95/p99-Aufschlüsselung und Histogramm-Buckets, wenn der Schnitt täuscht. -
kv-monitor-log-pipelineKonfiguriert Log-Pipelines mit Collector, Parser, Buffer, Backpressure, Sampling und Routing zum Zielsystem. -
kv-monitor-log-retention-tieringPlant Log-Aufbewahrung mit Hot/Warm/Cold-Stufen, Löschfristen, Index-Strategie und Kostenabschätzung. -
kv-monitor-metrics-instrumentationErstellt Instrumentierungs-Patches mit benannten Metriken, Labels und Kardinalitäts-Budget für blinde Dienste. -
kv-monitor-metrics-retentionPlant Metrik-Aufbewahrung mit Downsampling-Stufen, Auflösungs-Abstufung, Löschregeln und Speicherbedarf. -
kv-monitor-observability-cost-auditPrüft die Kosten des Beobachtungs-Stacks und liefert Aufschlüsselung plus priorisierte Einsparungs-Roadmap. -
kv-monitor-oncall-routingErstellt Eskalations- und Routing-Konfigurationen mit Bereitschaftsplan, Ketten und Stummschaltzeiten. -
kv-monitor-prometheus-exporterErstellt Exporter-Konfigurationen und Service-Discovery-Einträge, wenn Scrape-Endpoints leer bleiben. -
kv-monitor-slo-definitionFormuliert messbare SLOs mit SLI-Definitionen, PromQL-Mess-Queries und Fehlerbudget-Berechnung. -
kv-monitor-structured-loggingEntwirft strukturierte Log-Schemata mit Pflichtfeldern, Level-Semantik, Korrelations-IDs und Beispiel-Code. -
kv-monitor-synthetic-probingErstellt Synthetik-Check-Suiten mit Endpunkt-Probes, Multi-Step-Transaktionen und Standortverteilung. -
kv-monitor-trace-context-propagationBindet Trace-Context ein: Propagations-Header, Span-Erzeugung an Dienstgrenzen und Sampling-Konfiguration. -
kv-monitor-uptime-statuspageKonfiguriert Statusseiten mit Komponenten-Mapping, Incident-Vorlagen, Uptime-Aggregation und Abo-Kanälen.