Zasób · Słownik pojęć

    Czym jest MTTR (Mean Time To Repair)?

    MTTR, czyli Mean Time To Repair, to średni czas od wystąpienia awarii do ponownego działania usługi. To najpilniej obserwowany wskaźnik operacyjny, ponieważ nadaje każdej awarii wymierną cenę: przestój trwający 9 sekund to anegdota, ten sam przestój trwający 8 godzin to już incydent biznesowy.

    Rodzina wskaźników

    MTTR, MTBF, MTTD: co mierzy który wskaźnik

    MTBF

    Mean Time Between Failures: jak często dochodzi do awarii. Rośnie dzięki lepszemu sprzętowi i wcześniejszej interwencji.

    MTTD

    Mean Time To Detect: jak długo awaria pozostaje niezauważona. Cichy winowajca ukryty w wysokich wartościach MTTR.

    MTTR

    Mean Time To Repair: od wykrycia do przywrócenia usługi. Wskaźnik, na którym skupiają się SLA i analizy powdrożeniowe (postmortemy).

    Dostępność

    Wynik końcowy: MTBF ÷ (MTBF + MTTR). Poruszenie którejkolwiek z tych dźwigni przekłada się na uptime.

    Gdzie ukrywa się czas

    Większość czasu MTTR pochłania szukanie, nie naprawianie

    Rozbijając oś czasu incydentu na etapy, sama naprawa zwykle zajmuje minuty: wymiana dysku, restart usługi, przełączenie awaryjne. Godziny pochłania wszystko, co dzieje się wcześniej: zauważenie awarii, ustalenie, który z pięciu systemów faktycznie zawinił, zlokalizowanie urządzenia i potwierdzenie, co się zmieniło. Dlatego największe oszczędności w MTTR wynikają z kontekstu, a nie z samej szybkości działania: wczesne ostrzeganie na poziomie komponentów (skracające MTTD niemal do zera), alarmy skorelowane według topologii i uszeregowane według wpływu na biznes, rzetelne dane o zasobach precyzyjnie wskazujące, czym i gdzie jest dane urządzenie, oraz dostęp out-of-band pozwalający natychmiast przystąpić do pracy. W jednym z wdrożeń w firmie z branży papierów wartościowych analiza przyczyn źródłowych skróciła się z 8 godzin do kilku sekund, gdy dochodzenie zastąpiono rzetelnymi danymi konfiguracyjnymi.

    Wykrywanie na poziomie komponentu, nie zgłoszenia
    Skorelowane alarmy kończą przeskakiwanie między narzędziami
    Prawdziwe dane o zasobach eliminują etap „gdzie to jest”
    Dostęp OOB pozwala natychmiast rozpocząć naprawę
    Wykrycie awarii: 6h → 15 min (przypadek)
    FAQ

    Najczęstsze pytania o MTTR

    Co oznacza skrót MTTR?

    MTTR to Mean Time To Repair (lub Recovery/Resolve, zależnie od zespołu) — średni czas od wystąpienia awarii do przywrócenia usługi. To podstawowa miara tego, jak szybko zespół operacyjny wraca do działania.

    Czym różnią się MTTR, MTBF i MTTD?

    MTBF (Mean Time Between Failures) mierzy, jak często dochodzi do awarii; MTTD (Mean Time To Detect) mierzy, jak długo awaria pozostaje niezauważona; MTTR mierzy, ile trwa naprawa po jej wykryciu. Dostępność rośnie wraz ze zwiększaniem MTBF oraz skracaniem MTTD i MTTR.

    Jak obliczyć MTTR?

    MTTR = łączny czas przestoju ÷ liczba incydentów w danym okresie. Jeśli 4 incydenty spowodowały w kwartale 8 godzin przestoju, MTTR wynosi 2 godziny. Warto śledzić ten wskaźnik w podziale na usługi i typy awarii — uśrednianie wszystkiego maskuje obszary problemowe.

    Jak skrócić MTTR?

    Trzeba działać na jego składowe: wykrywać szybciej (telemetria na poziomie komponentów zamiast zgłoszeń użytkowników), diagnozować szybciej (dokładne dane o zasobach, topologia i skorelowane alarmy) oraz naprawiać szybciej (dostęp zdalny, runbooki, części zamienne dobierane na podstawie danych gwarancyjnych). Większość czasu MTTR kryje się w diagnozie, nie w samej naprawie.

    W Sensaka

    Skracanie fazy diagnozy

    Sensaka koncentruje się właśnie na tej części MTTR, którą jest diagnoza. DCOS wykrywa awarie sprzętowe out-of-band przez BMC, dzięki czemu serwer niewidoczny już dla systemu operacyjnego nadal zgłasza przyczynę problemu. iDCOS przechowuje dane o zasobach, konfiguracji i historię zmian, które odpowiadają na pytanie, co zmieniło się przed incydentem, a SmartBSM koreluje powstałe alerty w jeden incydent z nazwaną usługą, na którą ma on wpływ. Zobacz zarządzanie incydentami.

    Skróć szukanie, zostaw naprawianie.