Das Prüfnetz

Sechs Prüfregionen, eine je bewohntem Kontinent. Diese Seite ist die Architektur: wie ein Check läuft, wie Regionen abstimmen und was übereinstimmen muss, bevor jemand geweckt wird.

Die Regionen

RegionKontinent
na-ewrNordamerika
sa-gruSüdamerika
eu-fraEuropa
af-jnbAfrika
as-sgpAsien
oce-sydAustralien

Eine Region je bewohntem Kontinent, alle sechs aktiv. Pulse prüft aus 3 Regionen, ab Sentinel aus allen sechs. Die Regionscodes oben sind dieselben Codes, die Sie im Produkt sehen, im Beispiel-SLA-Report und auf Ihren Statusseiten.

Wie ein Check läuft

Die Prüfpunkte holen sich ihre Arbeit von der Control Plane, statt sie zugeschoben zu bekommen: Jeder Prüfpunkt fragt alle paar Sekunden nach den Checks, die in seiner Region fällig sind, führt sie aus und meldet das vollständige Ergebnis. Ein Prüfpunkt, der verstummt, nimmt keine Arbeit mehr an. Er kann Ihre Checks nicht stillschweigend fallen lassen.

Jeder Prüfpunkt betreibt seinen eigenen rekursiven, validierenden DNS-Resolver. DNS-Ergebnisse werden damit am echten DNS-Baum gemessen und nicht am Cache eines öffentlichen Resolvers, und dns_ms wird getrennt von der Gesamtlatenz ausgewiesen. So gibt sich ein langsamer Resolver nie als langsame Anwendung aus. Checks laufen im Dual-Stack über alle A- und AAAA-Records, mit Ergebnissen je IP.

Jeder Fehler wird einer Schicht zugeordnet, bevor er Sie erreicht: Ihre Anwendung, Ihr DNS, das Netz dazwischen, unser Resolver oder unser eigener Prüfpunkt. Liegt der Fehler bei uns, steht das in der Aufzeichnung.

Wie Regionen abstimmen

Zwischen einem fehlgeschlagenen Check und Ihrem Telefon liegen zwei Schwellen:

  1. Innerhalb einer Region: 75 % der Prüfpunkte einer Region müssen übereinstimmen, bevor die Region überhaupt abstimmt. Ein einzelner Prüfpunkt, der seinen Nachbarn widerspricht, wird als Drift verbucht, nicht als Ausfall.
  2. Über Regionen hinweg: Ein Incident wird erst eröffnet, wenn ein Quorum von Regionen den Fehler bestätigt, standardmäßig zwei Regionen, mit einem eigenen Quorum für die Bestätigung der Erholung. Ergebnisse, die älter als das Frischefenster sind, zählen nicht zum Quorum.

Unterhalb des Quorums wird nichts stillschweigend geschluckt: Ein entstehender Incident ist im Produkt sichtbar, mit der zuerst fehlschlagenden Region beim Namen, und Abweichungen unterhalb des Quorums (eine Region driftet, eine IP-Familie fällt aus, ein Prüfpunkt widerspricht) landen auf einer Beobachtungsliste, statt jemanden zu alarmieren. Ein Eintrag auf der Beobachtungsliste muss ein volles Prüfintervall überstehen, bevor er überhaupt gemeldet wird.

Der Startzeitpunkt des Incidents ist die Bestätigung durch das Quorum, auf die Sekunde genau. Es ist dieselbe Grenze, mit der später Ihre Verfügbarkeitsaufzeichnung rechnet.

Was wir bewusst nicht veröffentlichen

Die IP-Adressen der Prüfpunkte und die Hoster stehen hier nicht. Die Egress-Angaben der Prüfpunkte bekommen Kunden auf Anfrage, wenn sie sie für Freigabelisten brauchen. Die Prüfpunkte halten keine Kontodaten von Kunden: Sie messen und melden, und die Control Plane bleibt in der EU bei einem deutschen Unternehmen. Der Rest dieser Geschichte steht auf der Sicherheitsseite .

Zur Tour oder zu den Checktypen , die die Flotte ausführt.