MTBF
Mean time between failures, czyli średni czas między awariami: przeciętny odstęp między kolejnymi awariami elementu naprawialnego.
Inne nazwy: Średni czas między awariami (mean time between failures)
W praktyce
MTBF opisuje, jak często coś się psuje, w uśrednieniu dla populacji i okresu. To statystyczna właściwość floty urządzeń, a nie prognoza dla egzemplarza, który masz przed sobą. Element z MTBF liczonym w setkach tysięcy godzin może zepsuć się w przyszłym tygodniu; ta liczba mówi, że takie awarie są rzadkie w dużej populacji, a nie że twój egzemplarz ma zagwarantowaną bezawaryjną pracę.
Nie mówi też nic o tym, jak długo trwa awaria. Dostępność wymaga obu połówek – jak często coś się psuje i jak szybko przywraca się usługę – dlatego MTBF występuje obok średniego czasu naprawy (MTTR), a nie samodzielnie. Element, który psuje się często, ale wraca do pracy w kilka sekund, może dawać lepszą dostępność niż taki, który psuje się rzadko, a jego wymiana trwa dzień.
Publikowane wartości zwykle mają dołączone warunki: temperaturę pracy, cykl pracy, definicję tego, co uznaje się za awarię. Sprzęt pracujący poza tymi warunkami nie dziedziczy tej liczby, a warunki w gorącej szafie często nie są tymi, w których ją ustalono.
W przypadku powiązanych elementów naprawialnych często bardziej przydatne jest spojrzenie na intensywność awarii w interesującym cię okresie i na to, czy awarie są niezależne. Elementy, które dzielą środowisko, partię produkcyjną, wersję firmware albo źródło zasilania, zwykle nie psują się niezależnie – a arytmetyka, która czyni redundancję atrakcyjną, zakłada, że tak właśnie jest.
Zakres tej definicji
To edukacyjne streszczenie tego, jak termin funkcjonuje w praktyce centrów danych. Nie jest normą, specyfikacją ani poradą inżynierską. Gdy zależy od niego prawdziwa decyzja, właściwym źródłem są aktualnie przyjęte normy, zweryfikowane informacje o obiekcie i ocena wykwalifikowanego specjalisty.