Czym jest MTTR (Mean Time To Repair)?
MTTR, czyli Mean Time To Repair, to średni czas od wystąpienia awarii do ponownego działania usługi. To najpilniej obserwowany wskaźnik operacyjny, ponieważ nadaje każdej awarii wymierną cenę: przestój trwający 9 sekund to anegdota, ten sam przestój trwający 8 godzin to już incydent biznesowy.
MTTR, MTBF, MTTD: co mierzy który wskaźnik
MTBF
Mean Time Between Failures: jak często dochodzi do awarii. Rośnie dzięki lepszemu sprzętowi i wcześniejszej interwencji.
MTTD
Mean Time To Detect: jak długo awaria pozostaje niezauważona. Cichy winowajca ukryty w wysokich wartościach MTTR.
MTTR
Mean Time To Repair: od wykrycia do przywrócenia usługi. Wskaźnik, na którym skupiają się SLA i analizy powdrożeniowe (postmortemy).
Dostępność
Wynik końcowy: MTBF ÷ (MTBF + MTTR). Poruszenie którejkolwiek z tych dźwigni przekłada się na uptime.
Większość czasu MTTR pochłania szukanie, nie naprawianie
Rozbijając oś czasu incydentu na etapy, sama naprawa zwykle zajmuje minuty: wymiana dysku, restart usługi, przełączenie awaryjne. Godziny pochłania wszystko, co dzieje się wcześniej: zauważenie awarii, ustalenie, który z pięciu systemów faktycznie zawinił, zlokalizowanie urządzenia i potwierdzenie, co się zmieniło. Dlatego największe oszczędności w MTTR wynikają z kontekstu, a nie z samej szybkości działania: wczesne ostrzeganie na poziomie komponentów (skracające MTTD niemal do zera), alarmy skorelowane według topologii i uszeregowane według wpływu na biznes, rzetelne dane o zasobach precyzyjnie wskazujące, czym i gdzie jest dane urządzenie, oraz dostęp out-of-band pozwalający natychmiast przystąpić do pracy. W jednym z wdrożeń w firmie z branży papierów wartościowych analiza przyczyn źródłowych skróciła się z 8 godzin do kilku sekund, gdy dochodzenie zastąpiono rzetelnymi danymi konfiguracyjnymi.
Najczęstsze pytania o MTTR
Co oznacza skrót MTTR?
MTTR to Mean Time To Repair (lub Recovery/Resolve, zależnie od zespołu) — średni czas od wystąpienia awarii do przywrócenia usługi. To podstawowa miara tego, jak szybko zespół operacyjny wraca do działania.
Czym różnią się MTTR, MTBF i MTTD?
MTBF (Mean Time Between Failures) mierzy, jak często dochodzi do awarii; MTTD (Mean Time To Detect) mierzy, jak długo awaria pozostaje niezauważona; MTTR mierzy, ile trwa naprawa po jej wykryciu. Dostępność rośnie wraz ze zwiększaniem MTBF oraz skracaniem MTTD i MTTR.
Jak obliczyć MTTR?
MTTR = łączny czas przestoju ÷ liczba incydentów w danym okresie. Jeśli 4 incydenty spowodowały w kwartale 8 godzin przestoju, MTTR wynosi 2 godziny. Warto śledzić ten wskaźnik w podziale na usługi i typy awarii — uśrednianie wszystkiego maskuje obszary problemowe.
Jak skrócić MTTR?
Trzeba działać na jego składowe: wykrywać szybciej (telemetria na poziomie komponentów zamiast zgłoszeń użytkowników), diagnozować szybciej (dokładne dane o zasobach, topologia i skorelowane alarmy) oraz naprawiać szybciej (dostęp zdalny, runbooki, części zamienne dobierane na podstawie danych gwarancyjnych). Większość czasu MTTR kryje się w diagnozie, nie w samej naprawie.
Skracanie fazy diagnozy
Sensaka koncentruje się właśnie na tej części MTTR, którą jest diagnoza. DCOS wykrywa awarie sprzętowe out-of-band przez BMC, dzięki czemu serwer niewidoczny już dla systemu operacyjnego nadal zgłasza przyczynę problemu. iDCOS przechowuje dane o zasobach, konfiguracji i historię zmian, które odpowiadają na pytanie, co zmieniło się przed incydentem, a SmartBSM koreluje powstałe alerty w jeden incydent z nazwaną usługą, na którą ma on wpływ. Zobacz zarządzanie incydentami.
