Przejdź do treści
LAB-06 · ODPORNOŚĆ · MODEL OBLICZENIOWY

Budżet dostępności

Zobacz, jak niewielka różnica w procentach daje gwałtownie mniejszy roczny limit niedostępności.

Czego uczy ten eksperyment

  • Przelicz procenty na minuty
  • Jawnie określ okres rozliczeniowy
  • Nie traktuj celu SLA jako wyniku topologii

Ten samodzielny model dydaktyczny wyodrębnia jeden mechanizm, tak aby jego dane wejściowe i skutki dało się prześledzić. Etykieta „obliczony” opisuje rodzaj wyniku – nie zamienia go w zmierzone dane obiektu, dobór produktu, projekt po rozruchu ani profesjonalną poradę.

Przewiduj, zanim zmienisz model

Przewidź, o jaki rząd wielkości zmieni się przestój po dodaniu do celu kolejnej dziewiątki.

Zapisz własnymi słowami oczekiwany kierunek zmiany. Potem zmieniaj po jednym parametrze i porównuj wynik z prognozą. Jeśli wynik cię zaskoczy, otwórz kartę modelu i sprawdź granicę oraz założenia, zanim dopiszesz do liczby lub stanu jakąkolwiek historię.

Obciążenie i podsumowanie

Porównaj ten sam łączny przestój jako jedną długą awarię i jako wiele krótkich incydentów, a potem wypisz, czego ten prosty budżet nie rozróżnia.

Dobre podsumowanie nazywa osobno cztery rzeczy: zmieniony parametr, modelowany skutek, ważne efekty, których nie oceniono, oraz dane z obiektu lub prace inżynierskie potrzebne przed prawdziwą decyzją. Laboratorium celowo unika uniwersalnej punktacji, bo energia, odporność, pojemność, łatwość utrzymania i ryzyko to różne wymiary.

SLA to mierzalne zobowiązanie

Umowa o poziomie usług (SLA) określa usługę, okno pomiaru, wyłączenia i konsekwencje niedotrzymania celu. Samo „99,9%” to za mało: liczą się mierzony punkt końcowy, zegar, sposób obliczania, zasady dotyczące konserwacji i rekompensata.

Przy wysokich celach procent dostępności zamienia się w mały budżet przestojów. Dlatego operatorzy potrzebują monitoringu, który mierzy tę samą usługę, z której korzysta klient, a nie tylko zielonych lampek infrastruktury.

Czas przywracania to zmienna inżynierska

MTBF podsumowuje średni czas pracy między awariami naprawialnymi. MTTR zwykle oznacza średni czas naprawy lub przywrócenia działania, ale zespół musi ustalić, które z nich. Szybsze wykrywanie, jasne procedury operacyjne (runbooki), dostępne części zamienne, przećwiczona eskalacja i odwracalne zmiany mogą skrócić czas przywracania.

Bardzo niezawodny komponent wciąż może spowodować długi przestój, jeśli diagnoza lub wymiana trwa długo. I odwrotnie: komponent, który psuje się częściej, może mieć ograniczony wpływ na usługę, jeśli jest odizolowany i szybko przywracany.

Domeny awarii ograniczają zasięg rażenia

Domena awarii to zbiór zasobów, które według przewidywań zawiodą razem: szafa, tor zasilania, strefa sieci, obieg chłodzenia, klaster oprogramowania albo cały obiekt. Redundancja powinna wychodzić poza granicę tej awarii, którą ma przetrwać.

Dokumentuj zależności i testuj założenia. Dwie usługi w różnych szafach wciąż mogą dzielić przełącznik, PDU, warstwę sterowania (control plane) lub proces zmian. Awarie o wspólnej przyczynie i błędy ludzkie często ignorują etykiety narysowane na schemacie.

Dziewiątki jako budżet przestojów

Procent dostępności staje się konkretny dopiero po przeliczeniu na czas. W roku liczącym 365 dni 99% zostawia około 3 dni i 15 godzin dopuszczalnego przestoju; 99,9% – około 8 godzin 46 minut; 99,95% – około 4 godzin 23 minut; 99,99% – około 52 minut, a 99,999% – około 5 minut 15 sekund. Każda kolejna dziewiątka zmniejsza budżet mniej więcej dziesięciokrotnie.

Czytanie ich jako budżetów zmienia rozmowę. Pięć minut rocznie to mniej niż jeden nieplanowany restart, więc taki cel tak naprawdę w ogóle nie dotyczy sprzętu – to deklaracja o tym, jak zbudowana jest usługa, jak szybko wykrywa się awarię i czy przywracanie działa automatycznie. Zobowiązanie do liczby bez odpowiadającej jej zdolności wykrywania i przywracania to zobowiązanie do wypłacania rekompensat.

Łańcuchy mnożą, pary się uzupełniają

Dostępności zależności połączonych szeregowo się mnożą: trzy komponenty po 99,9%, wszystkie niezbędne, dają razem około 99,7%. Każda kolejna niezbędna zależność obniża wynik, dlatego długi łańcuch komponentów, z których każdy z osobna jest znakomity, może dać rozczarowującą usługę. Wypisanie tego, czego usługa naprawdę wymaga, często mówi więcej niż ulepszenie któregokolwiek pojedynczego elementu z listy.

Naprawdę niezależne elementy redundantne działają odwrotnie – zestaw zawodzi dopiero wtedy, gdy zawiodą oba, więc arytmetyka mocno działa na twoją korzyść. Cały ciężar niesie tu słowo „niezależne”. Dwa elementy, które dzielą tor zasilania, system sterowania, ścieżkę sieciową albo szafę, nie są niezależne i ta optymistyczna arytmetyka po prostu ich nie dotyczy.

Idź dalej tropem dowodów

Otwórz powiązaną lekcję Akademii. Znajdziesz w niej wzór lub mechanizm, częste nieporozumienie, test wiedzy i kontekst źródłowy, które otaczają ten zwięzły eksperyment.

Źródła na początek

W prawdziwej pracy nadal potrzebne są aktualne normy, przyjęte wymagania, zweryfikowane informacje o obiekcie, dane producenta i ocena wykwalifikowanego specjalisty.

Powiązane materiały

Lekcja stojąca za tym modelem

Policz to

  • Kalkulator dostępności – Przelicz procent dostępności na dopuszczalny przestój w roku, miesiącu i tygodniu, a potem sprawdź, ile incydentów ten budżet wytrzyma przy twoim MTTR.
  • Kalkulator autonomii UPS – Oszacuj autonomię baterii UPS w minutach z obciążenia, napięcia szyny DC, pojemności łańcucha i głębokości rozładowania, z korektą na szybkie rozładowanie.
  • Kalkulator czasu pracy agregatu – Oszacuj spalanie i czas pracy agregatu diesla z obciążenia i pojemności zbiornika – ze współczynnikiem obciążenia, tankowaniami i celem 72 godzin.

Ścieżki, które korzystają z tego laboratorium

  • Odporność i eksploatacja – Zamiast liczyć zapasowe skrzynki, myśl kompletnymi torami, stanami pracy, alarmami i jawnymi granicami odtwarzania.

Inne laboratoria

  • Ścieżka pakietu – Prześledź dostęp punktów końcowych, reprezentatywne tory sieci fabric i jedną wspólną granicę meet-me room, nie udając, że wymiarujesz prawdziwą sieć.
  • Granica PUE – Zbuduj roczny bilans energii obiektu i zobacz, które dokładnie obciążenia pomocnicze zmieniają szacowane PUE.
  • Tor zasilania – Wybierz topologię, usuwaj komponenty i obserwuj, które kompletne tory wciąż docierają do szafy z dwoma zasilaczami.
  • Ewolucja termiczna – Rozwijaj jeden koncepcyjny rząd szaf i pokaż bypass, recyrkulację, gęstość oraz awarię jednostki chłodzącej.