Was ist MTTR (Mean Time To Repair)?
MTTR – Mean Time To Repair – ist die durchschnittliche Zeit von einem Ausfall bis zur Wiederherstellung des Service. Es ist die am meisten beachtete Betriebskennzahl, weil sie jedem Ausfall einen Preis gibt: Ein Ausfall von 9 Sekunden ist eine Randnotiz; derselbe Ausfall über 8 Stunden ist ein Business-Incident.
MTTR, MTBF, MTTD: Wer misst was
MTBF
Mean Time Between Failures: wie oft etwas ausfällt. Wird durch bessere Hardware und früheres Eingreifen erhöht.
MTTD
Mean Time To Detect: wie lange ein Ausfall unbemerkt bleibt. Der stille Treiber hinter langen MTTR-Werten.
MTTR
Mean Time To Repair: von der Erkennung bis zur Wiederherstellung. Der Wert, um den sich SLAs und Postmortems drehen.
Verfügbarkeit
Das Ergebnis: MTBF ÷ (MTBF + MTTR). Bewegen Sie einen der beiden Hebel, folgt die Verfügbarkeit.
Der Großteil der MTTR geht für das Finden drauf, nicht für das Beheben
Zerlegt man den zeitlichen Ablauf eines Incidents, dauert die eigentliche Reparatur meist nur Minuten: Festplatte tauschen, Service neu starten, Failover auslösen. Die Stunden gehen für alles davor drauf: den Ausfall überhaupt bemerken, herausfinden, welches von fünf Systemen tatsächlich betroffen ist, das Gerät lokalisieren und klären, was sich geändert hat. Deshalb kommen die größten MTTR-Verbesserungen aus Kontext, nicht aus Geschwindigkeit: Frühwarnung auf Komponentenebene (die MTTD gegen null drückt), nach Topologie korrelierte und nach Business-Impact priorisierte Alarme, Asset-Datensätze, die genau sagen, was das Gerät ist und wo es steht, sowie Out-of-Band-Zugriff, um sofort daran zu arbeiten. Bei einem Einsatz im Wertpapierbereich sank die Ursachenanalyse von 8 Stunden auf Sekunden, sobald verlässliche Konfigurationsdaten die Recherche ersetzten.
Häufige Fragen zu MTTR
Wofür steht MTTR?
MTTR steht für Mean Time To Repair (je nach Team auch Recovery/Resolve) – die durchschnittliche Zeit vom Eintreten eines Ausfalls bis zur Wiederherstellung des Service. Sie ist die zentrale Kennzahl dafür, wie schnell sich der Betrieb erholt.
Was ist der Unterschied zwischen MTTR, MTBF und MTTD?
MTBF (Mean Time Between Failures) misst, wie oft etwas ausfällt; MTTD (Mean Time To Detect) misst, wie lange ein Ausfall unbemerkt bleibt; MTTR misst, wie lange die Reparatur nach der Erkennung dauert. Die Verfügbarkeit verbessert sich, indem MTBF erhöht und MTTD sowie MTTR verkürzt werden.
Wie wird MTTR berechnet?
MTTR = gesamte Ausfallzeit ÷ Anzahl der Incidents in einem Zeitraum. Verursachen 4 Incidents in einem Quartal 8 Stunden Ausfallzeit, beträgt MTTR 2 Stunden. Erfassen Sie den Wert pro Service und pro Fehlertyp: Durchschnittswerte über alles hinweg verdecken die eigentlichen Problembereiche.
Wie lässt sich MTTR reduzieren?
Setzen Sie an den einzelnen Bestandteilen an: schneller erkennen (Telemetrie auf Komponentenebene statt Nutzermeldungen), schneller diagnostizieren (verlässliche Asset-Daten, Topologie und korrelierte Alarme) und schneller reparieren (Remote-Zugriff, Runbooks, Ersatzteile auf Basis von Garantiedaten). Der größte Teil der MTTR steckt in der Diagnose, nicht in der Reparatur.
Ansatzpunkt: die Diagnose-Hälfte
Sensaka setzt genau bei dem Teil der MTTR an, der die Diagnose ist. DCOS erkennt Hardwarefehler Out-of-Band über den BMC, sodass ein Server, der für sein Betriebssystem bereits ausgefallen ist, weiterhin meldet, warum. iDCOS hält Asset-, Konfigurations- und Änderungshistorie vor, die beantwortet, was sich vor dem Incident geändert hat, und SmartBSM korreliert die resultierenden Alarme zu einem Incident mit benanntem betroffenem Service. Siehe Incident Management.
