Przejdź do treści
AKADEMIA OPERATORA · SŁOWNIK · HASŁO

MTBF

Mean time between failures, czyli średni czas między awariami: przeciętny odstęp między kolejnymi awariami elementu naprawialnego.

Inne nazwy: Średni czas między awariami (mean time between failures)

W praktyce

MTBF opisuje, jak często coś się psuje, w uśrednieniu dla populacji i okresu. To statystyczna właściwość floty urządzeń, a nie prognoza dla egzemplarza, który masz przed sobą. Element z MTBF liczonym w setkach tysięcy godzin może zepsuć się w przyszłym tygodniu; ta liczba mówi, że takie awarie są rzadkie w dużej populacji, a nie że twój egzemplarz ma zagwarantowaną bezawaryjną pracę.

Nie mówi też nic o tym, jak długo trwa awaria. Dostępność wymaga obu połówek – jak często coś się psuje i jak szybko przywraca się usługę – dlatego MTBF występuje obok średniego czasu naprawy (MTTR), a nie samodzielnie. Element, który psuje się często, ale wraca do pracy w kilka sekund, może dawać lepszą dostępność niż taki, który psuje się rzadko, a jego wymiana trwa dzień.

Publikowane wartości zwykle mają dołączone warunki: temperaturę pracy, cykl pracy, definicję tego, co uznaje się za awarię. Sprzęt pracujący poza tymi warunkami nie dziedziczy tej liczby, a warunki w gorącej szafie często nie są tymi, w których ją ustalono.

W przypadku powiązanych elementów naprawialnych często bardziej przydatne jest spojrzenie na intensywność awarii w interesującym cię okresie i na to, czy awarie są niezależne. Elementy, które dzielą środowisko, partię produkcyjną, wersję firmware albo źródło zasilania, zwykle nie psują się niezależnie – a arytmetyka, która czyni redundancję atrakcyjną, zakłada, że tak właśnie jest.

Zakres tej definicji

To edukacyjne streszczenie tego, jak termin funkcjonuje w praktyce centrów danych. Nie jest normą, specyfikacją ani poradą inżynierską. Gdy zależy od niego prawdziwa decyzja, właściwym źródłem są aktualnie przyjęte normy, zweryfikowane informacje o obiekcie i ocena wykwalifikowanego specjalisty.

Wróć do słownika A–Z · Akademia Operatora

Powiązane materiały

Powiązane pojęcia

  • MTTR – Mean time to repair lub mean time to restore, czyli średni czas naprawy lub przywrócenia działania: przeciętny czas od awarii do chwili, gdy usługa znów nadaje się do użytku.
  • Domena awarii – Zbiór zasobów, które według założeń dotknie ta sama pierwotna awaria.
  • Pojedynczy punkt awarii (SPOF) – Każdy element, tor lub wspólna zależność, których utrata wyłącza usługę – bez względu na to, ile redundantnego sprzętu jest wokół.

Gdzie pojawia się to pojęcie

Materiały referencyjne