Vier Säulen, ein Produkt: Monitoring, Statusseiten, Incidents und Rufbereitschaft, Nachweise. Diese Seite ist die Tour. Ohne Registrierung.
01 · monitoring
Uptime-Monitoring
12 ChecktypenHTTP mit Assertions, Security-Header, DNS und DNS-Hygiene, Domain- und TLS-Ablauf, SMTP, IMAP, TCP, Ping, Traceroute und Host-Agents. Intervalle bis hinunter zu 10 Sekunden, je nach Tarif. Die Referenz erklärt jeden einzelnen.
Quorum über mehrere Regionen.Ein Alarm wird ausgelöst, nachdem mehr als eine Region bestätigt hat, damit eine einzelne wacklige Route niemanden weckt.
Host-Agents für Linux und macOS.CPU, Arbeitsspeicher, Platte und Dienste. Aktualisieren sich selbst.
Wartungsfenster.Geplante Arbeiten werden Ihnen nicht angerechnet, und das Fenster steht in der Aufzeichnung.
Abb. 01 · Das Cockpit. Echte Produktoberfläche, Beispieldaten.
Abb. 02 · Ein Monitor aus der Nähe: Uptime, Antwortzeit, TLS-Zertifikat, Latenz je Region. Beispieldaten.
Ihre eigene Domain.status.ihrefirma.de, keine gemietete Subdomain.
Öffentlich oder privat.Offen für alle, mit gemeinsamem Passwort oder mit Betrachterkonten.
Abonnenten per Double-Opt-in.Die Leute auf Ihrer Liste haben tatsächlich darum gebeten.
White-Labelab Command: Ihre Marke, nicht unsere.
status.example.comalle systeme betriebsbereit
Beispielhafte Uptime der Komponenten einer Statusseite
komponente
uptime, 90 tage
API
99,99 %
Dashboard
100 %
Webhooks
99,97 %
Abb. 03 · Eine Statusseite, reduziert auf ihre Komponenten. Beispieldaten.
03 · incidents und rufbereitschaft
Incidents und Rufbereitschaft
Eskalation, bis jemand quittiert.Push, dann SMS, dann ein Anruf. Zeiten je Bereitschaftsplan.
Jedes Telefon.Die Eskalation ist plattformneutral. Die native iOS-App mit Apple Watch ist eine Zugabe für Apple-Nutzer, keine Voraussetzung.
Post-mortems mit Maßnahmen.Am Incident hängend, statt über Chat und Wiki verteilt.
Manuelle Incidents.Öffnen, kuratieren und auf Ihrer Statusseite veröffentlichen.
00:00 check schlägt fehl · eu-fra 00:30 quorum bestätigt · na-ewr, as-sgp 00:30 push → person in bereitschaft 05:30 keine quittung → sms 10:30 keine quittung → anruf 11:12quittiert · incident-zeitachse offen
Abb. 04 · Eskalationskette, Beispielverlauf. Zeiten je Bereitschaftsplan konfigurierbar.
04 · nachweise
Nachweise
SLA-Reports mit kuratierten Ausschlussfenstern.Echte Fenstergrenzen: der bestätigte Beginn eines Incidents, keine schmeichelhafte Näherung.
Zum Weitergeben gebaut.An einen Kunden, einen Prüfer oder eine Aufsicht, als SLA-Report, der sich wie die Aufzeichnung dahinter liest, Grenze für Grenze.
Aufbewahrung, die zum Report passt.Die Fenster, aus denen ein SLA-Report schöpft, sind die Fenster, die wir vorhalten, je Tarif, nachzulesen in den Limits.
Das vollständige Dokument sagt mehr als jede Beschreibung: