SLA, dostępność, MTTR i domeny awarii
Niezawodność to rezultat usługi: określ, co musi pozostać dostępne, jak izoluje się awarię i jak szybko operatorzy mogą przywrócić działanie.

Efekty nauki
- Przelicz procent SLA na budżet przestojów
- Wyjaśnij role MTBF i MTTR
- Wyznacz przydatną granicę domeny awarii
DOSTĘPNOŚĆ WŁASNA
A = MTBF ÷ (MTBF + MTTR)
Dostępność operacyjna może też uwzględniać konserwację, logistykę i opóźnienia administracyjne.
SLA to mierzalne zobowiązanie
Umowa o poziomie usług (SLA) określa usługę, okno pomiaru, wyłączenia i konsekwencje niedotrzymania celu. Samo „99,9%” to za mało: liczą się mierzony punkt końcowy, zegar, sposób obliczania, zasady dotyczące konserwacji i rekompensata.
Przy wysokich celach procent dostępności zamienia się w mały budżet przestojów. Dlatego operatorzy potrzebują monitoringu, który mierzy tę samą usługę, z której korzysta klient, a nie tylko zielonych lampek infrastruktury.
Czas przywracania to zmienna inżynierska
MTBF podsumowuje średni czas pracy między awariami naprawialnymi. MTTR zwykle oznacza średni czas naprawy lub przywrócenia działania, ale zespół musi ustalić, które z nich. Szybsze wykrywanie, jasne procedury operacyjne (runbooki), dostępne części zamienne, przećwiczona eskalacja i odwracalne zmiany mogą skrócić czas przywracania.
Bardzo niezawodny komponent wciąż może spowodować długi przestój, jeśli diagnoza lub wymiana trwa długo. I odwrotnie: komponent, który psuje się częściej, może mieć ograniczony wpływ na usługę, jeśli jest odizolowany i szybko przywracany.
Domeny awarii ograniczają zasięg rażenia
Domena awarii to zbiór zasobów, które według przewidywań zawiodą razem: szafa, tor zasilania, strefa sieci, obieg chłodzenia, klaster oprogramowania albo cały obiekt. Redundancja powinna wychodzić poza granicę tej awarii, którą ma przetrwać.
Dokumentuj zależności i testuj założenia. Dwie usługi w różnych szafach wciąż mogą dzielić przełącznik, PDU, warstwę sterowania (control plane) lub proces zmian. Awarie o wspólnej przyczynie i błędy ludzkie często ignorują etykiety narysowane na schemacie.
Dziewiątki jako budżet przestojów
Procent dostępności staje się konkretny dopiero po przeliczeniu na czas. W roku liczącym 365 dni 99% zostawia około 3 dni i 15 godzin dopuszczalnego przestoju; 99,9% – około 8 godzin 46 minut; 99,95% – około 4 godzin 23 minut; 99,99% – około 52 minut, a 99,999% – około 5 minut 15 sekund. Każda kolejna dziewiątka zmniejsza budżet mniej więcej dziesięciokrotnie.
Czytanie ich jako budżetów zmienia rozmowę. Pięć minut rocznie to mniej niż jeden nieplanowany restart, więc taki cel tak naprawdę w ogóle nie dotyczy sprzętu – to deklaracja o tym, jak zbudowana jest usługa, jak szybko wykrywa się awarię i czy przywracanie działa automatycznie. Zobowiązanie do liczby bez odpowiadającej jej zdolności wykrywania i przywracania to zobowiązanie do wypłacania rekompensat.
Łańcuchy mnożą, pary się uzupełniają
Dostępności zależności połączonych szeregowo się mnożą: trzy komponenty po 99,9%, wszystkie niezbędne, dają razem około 99,7%. Każda kolejna niezbędna zależność obniża wynik, dlatego długi łańcuch komponentów, z których każdy z osobna jest znakomity, może dać rozczarowującą usługę. Wypisanie tego, czego usługa naprawdę wymaga, często mówi więcej niż ulepszenie któregokolwiek pojedynczego elementu z listy.
Naprawdę niezależne elementy redundantne działają odwrotnie – zestaw zawodzi dopiero wtedy, gdy zawiodą oba, więc arytmetyka mocno działa na twoją korzyść. Cały ciężar niesie tu słowo „niezależne”. Dwa elementy, które dzielą tor zasilania, system sterowania, ścieżkę sieciową albo szafę, nie są niezależne i ta optymistyczna arytmetyka po prostu ich nie dotyczy.
Jak to wygląda w Data Center Fan
Kontrakty deklarują wymagania dotyczące mocy obliczeniowej, pamięci, przepustowości i SLA. Incydenty odczytują rzeczywisty stan obiektu, wymuszony przestój przerywa usługę, a po nim dostępność odbudowuje się stopniowo, zamiast od razu wracać do ideału.
Częste nieporozumienie
„99,9% oznacza, że dopuszczalna jest tylko jedna krótka awaria”. Budżet sumuje się w podanym oknie, chyba że umowa stanowi inaczej.
Test wiedzy
Która zmiana najbardziej bezpośrednio poprawia dostępność, gdy MTBF się nie zmienia?
- Skrócenie MTTR
- Zwiększenie wysokości szafy
- Dodanie nieużywanych adresów IP
Przy stałym MTBF skrócenie czasu przywracania zmniejsza udział czasu, w którym usługa jest niedostępna.
Najczęściej zadawane pytania
Ile przestoju oznacza dostępność 99,9%?
Około 8 godzin i 46 minut w roku liczącym 365 dni, czyli mniej więcej 43 minuty miesięcznie. Każda kolejna dziewiątka dzieli to mniej więcej przez dziesięć: 99,99% to około 52 minut rocznie, a 99,999% – około 5 minut 15 sekund.
Co to jest MTTR?
Średni czas naprawy lub przywrócenia działania (mean time to repair/restore) – średni czas od awarii do chwili, gdy usługa znów nadaje się do użytku. Obejmuje wykrycie, diagnozę, wysłanie ekipy, samą naprawę i weryfikację, dlatego jest zmienną inżynierską i organizacyjną, a nie właściwością uszkodzonej części.
Co to jest MTBF?
Średni czas między awariami (mean time between failures): średni odstęp między awariami elementu naprawialnego. Opisuje, jak często coś się psuje, a nie jak długo trwa naprawa – a do wyznaczenia dostępności potrzebne są obie wielkości.
Co to jest domena awarii?
Zbiór zasobów, które według przewidywań dotknie ta sama pierwotna awaria – szafa, rząd, tor zasilania, sala, obiekt lub region, w zależności od tego, gdzie postawisz granicę. Przydatne granice domen to te, które odpowiadają temu, jak awarie faktycznie się rozprzestrzeniają, a nie te, które odpowiadają schematowi organizacyjnemu.
Czym różni się dostępność od niezawodności?
Niezawodność mówi o tym, jak długo coś działa bez awarii. Dostępność to udział okresu, w którym usługa nadaje się do użytku – łączy więc częstotliwość awarii z szybkością przywracania działania. Komponent, który psuje się często, ale natychmiast wraca do pracy, może mieć wysoką dostępność i słabą niezawodność.
Czy rekompensata z SLA pokrywa koszt awarii?
Prawie nigdy. Rekompensaty (service credits) to środek umowny, zwykle część opłaty za okres, którego dotyczyła awaria, i nie są miarą skutków biznesowych. Traktowanie ich jak ubezpieczenia to częste i kosztowne nieporozumienie co do tego, czemu służy SLA.