Ressource · Glossar

    Was ist MTTR (Mean Time To Repair)?

    MTTR – Mean Time To Repair – ist die durchschnittliche Zeit von einem Ausfall bis zur Wiederherstellung des Service. Es ist die am meisten beachtete Betriebskennzahl, weil sie jedem Ausfall einen Preis gibt: Ein Ausfall von 9 Sekunden ist eine Randnotiz; derselbe Ausfall über 8 Stunden ist ein Business-Incident.

    Die Kennzahlenfamilie

    MTTR, MTBF, MTTD: Wer misst was

    MTBF

    Mean Time Between Failures: wie oft etwas ausfällt. Wird durch bessere Hardware und früheres Eingreifen erhöht.

    MTTD

    Mean Time To Detect: wie lange ein Ausfall unbemerkt bleibt. Der stille Treiber hinter langen MTTR-Werten.

    MTTR

    Mean Time To Repair: von der Erkennung bis zur Wiederherstellung. Der Wert, um den sich SLAs und Postmortems drehen.

    Verfügbarkeit

    Das Ergebnis: MTBF ÷ (MTBF + MTTR). Bewegen Sie einen der beiden Hebel, folgt die Verfügbarkeit.

    Wo die Zeit verschwindet

    Der Großteil der MTTR geht für das Finden drauf, nicht für das Beheben

    Zerlegt man den zeitlichen Ablauf eines Incidents, dauert die eigentliche Reparatur meist nur Minuten: Festplatte tauschen, Service neu starten, Failover auslösen. Die Stunden gehen für alles davor drauf: den Ausfall überhaupt bemerken, herausfinden, welches von fünf Systemen tatsächlich betroffen ist, das Gerät lokalisieren und klären, was sich geändert hat. Deshalb kommen die größten MTTR-Verbesserungen aus Kontext, nicht aus Geschwindigkeit: Frühwarnung auf Komponentenebene (die MTTD gegen null drückt), nach Topologie korrelierte und nach Business-Impact priorisierte Alarme, Asset-Datensätze, die genau sagen, was das Gerät ist und wo es steht, sowie Out-of-Band-Zugriff, um sofort daran zu arbeiten. Bei einem Einsatz im Wertpapierbereich sank die Ursachenanalyse von 8 Stunden auf Sekunden, sobald verlässliche Konfigurationsdaten die Recherche ersetzten.

    Erkennung an der Komponente, nicht an der Beschwerde
    Korrelierte Alarme beenden den Wechsel zwischen Tools
    Verlässliche Asset-Daten beenden die Phase „Wo befindet es sich?“
    OOB-Zugriff startet die Reparatur sofort
    Fehlererkennung 6 Std. → 15 Min. (Fallbeispiel)
    FAQ

    Häufige Fragen zu MTTR

    Wofür steht MTTR?

    MTTR steht für Mean Time To Repair (je nach Team auch Recovery/Resolve) – die durchschnittliche Zeit vom Eintreten eines Ausfalls bis zur Wiederherstellung des Service. Sie ist die zentrale Kennzahl dafür, wie schnell sich der Betrieb erholt.

    Was ist der Unterschied zwischen MTTR, MTBF und MTTD?

    MTBF (Mean Time Between Failures) misst, wie oft etwas ausfällt; MTTD (Mean Time To Detect) misst, wie lange ein Ausfall unbemerkt bleibt; MTTR misst, wie lange die Reparatur nach der Erkennung dauert. Die Verfügbarkeit verbessert sich, indem MTBF erhöht und MTTD sowie MTTR verkürzt werden.

    Wie wird MTTR berechnet?

    MTTR = gesamte Ausfallzeit ÷ Anzahl der Incidents in einem Zeitraum. Verursachen 4 Incidents in einem Quartal 8 Stunden Ausfallzeit, beträgt MTTR 2 Stunden. Erfassen Sie den Wert pro Service und pro Fehlertyp: Durchschnittswerte über alles hinweg verdecken die eigentlichen Problembereiche.

    Wie lässt sich MTTR reduzieren?

    Setzen Sie an den einzelnen Bestandteilen an: schneller erkennen (Telemetrie auf Komponentenebene statt Nutzermeldungen), schneller diagnostizieren (verlässliche Asset-Daten, Topologie und korrelierte Alarme) und schneller reparieren (Remote-Zugriff, Runbooks, Ersatzteile auf Basis von Garantiedaten). Der größte Teil der MTTR steckt in der Diagnose, nicht in der Reparatur.

    In Sensaka

    Ansatzpunkt: die Diagnose-Hälfte

    Sensaka setzt genau bei dem Teil der MTTR an, der die Diagnose ist. DCOS erkennt Hardwarefehler Out-of-Band über den BMC, sodass ein Server, der für sein Betriebssystem bereits ausgefallen ist, weiterhin meldet, warum. iDCOS hält Asset-, Konfigurations- und Änderungshistorie vor, die beantwortet, was sich vor dem Incident geändert hat, und SmartBSM korreliert die resultierenden Alarme zu einem Incident mit benanntem betroffenem Service. Siehe Incident Management.

    Weniger Suchen. Mehr Beheben.