die tour · ohne registrierung

Produkt

Vier Säulen, ein Produkt: Monitoring, Statusseiten, Incidents und Rufbereitschaft, Nachweise. Diese Seite ist die Tour. Ohne Registrierung.

01 · monitoring

Uptime-Monitoring

  • 12 ChecktypenHTTP mit Assertions, Security-Header, DNS und DNS-Hygiene, Domain- und TLS-Ablauf, SMTP, IMAP, TCP, Ping, Traceroute und Host-Agents. Intervalle bis hinunter zu 10 Sekunden, je nach Tarif. Die Referenz erklärt jeden einzelnen.
  • Quorum über mehrere Regionen.Ein Alarm wird ausgelöst, nachdem mehr als eine Region bestätigt hat, damit eine einzelne wacklige Route niemanden weckt.
  • Host-Agents für Linux und macOS.CPU, Arbeitsspeicher, Platte und Dienste. Aktualisieren sich selbst.
  • Wartungsfenster.Geplante Arbeiten werden Ihnen nicht angerechnet, und das Fenster steht in der Aufzeichnung.
Das Perstat-Cockpit: laufende Aktivität über alle Dienste, aktive Incidents, Statuswechsel und Latenz je Region.
Abb. 01 · Das Cockpit. Echte Produktoberfläche, Beispieldaten.
Ein einzelner Monitor im Detail: Uptime, Antwortzeit, p95, Anzahl der Checks, das TLS-Zertifikat und ein Diagramm der Antwortzeiten je Region.
Abb. 02 · Ein Monitor aus der Nähe: Uptime, Antwortzeit, TLS-Zertifikat, Latenz je Region. Beispieldaten.

Tiefer einsteigen: Uptime-Monitoring, die 12 Checktypen, das Prüfnetz.

02 · statusseiten

Statusseiten

  • Ihre eigene Domain.status.ihrefirma.de, keine gemietete Subdomain.
  • Öffentlich oder privat.Offen für alle, mit gemeinsamem Passwort oder mit Betrachterkonten.
  • Abonnenten per Double-Opt-in.Die Leute auf Ihrer Liste haben tatsächlich darum gebeten.
  • White-Labelab Command: Ihre Marke, nicht unsere.
status.example.comalle systeme betriebsbereit
Beispielhafte Uptime der Komponenten einer Statusseite
komponenteuptime, 90 tage
API99,99 %
Dashboard100 %
Webhooks99,97 %
Abb. 03 · Eine Statusseite, reduziert auf ihre Komponenten. Beispieldaten.
03 · incidents und rufbereitschaft

Incidents und Rufbereitschaft

  • Eskalation, bis jemand quittiert.Push, dann SMS, dann ein Anruf. Zeiten je Bereitschaftsplan.
  • Jedes Telefon.Die Eskalation ist plattformneutral. Die native iOS-App mit Apple Watch ist eine Zugabe für Apple-Nutzer, keine Voraussetzung.
  • Post-mortems mit Maßnahmen.Am Incident hängend, statt über Chat und Wiki verteilt.
  • Manuelle Incidents.Öffnen, kuratieren und auf Ihrer Statusseite veröffentlichen.
00:00  check schlägt fehl · eu-fra
00:30  quorum bestätigt · na-ewr, as-sgp
00:30  push → person in bereitschaft
05:30  keine quittung → sms
10:30  keine quittung → anruf
11:12  quittiert · incident-zeitachse offen
Abb. 04 · Eskalationskette, Beispielverlauf. Zeiten je Bereitschaftsplan konfigurierbar.
04 · nachweise

Nachweise

  • SLA-Reports mit kuratierten Ausschlussfenstern.Echte Fenstergrenzen: der bestätigte Beginn eines Incidents, keine schmeichelhafte Näherung.
  • Zum Weitergeben gebaut.An einen Kunden, einen Prüfer oder eine Aufsicht, als SLA-Report, der sich wie die Aufzeichnung dahinter liest, Grenze für Grenze.
  • Aufbewahrung, die zum Report passt.Die Fenster, aus denen ein SLA-Report schöpft, sind die Fenster, die wir vorhalten, je Tarif, nachzulesen in den Limits.

Das vollständige Dokument sagt mehr als jede Beschreibung:

Den Beispiel-SLA-Report ansehen

Geschrieben für Ihre Rolle: Entwickler, DevOps und SRE, Leadership.

Der erste Check läuft in Minuten.