Redundancja: N, N+1 i 2N
Zbuduj tyle zapasu, żeby przetrwać awarię, na którą faktycznie projektujesz – i nie myl dodatkowych skrzynek z niezależnymi torami.

Efekty nauki
- Wyraź wymaganą moc jako N
- Porównaj N+1 z w pełni zdublowanymi torami 2N
- Sprawdź projekt w scenariuszach konserwacji i awarii
WYMAGANA MOC
N = CAPACITY REQUIRED TO CARRY THE DESIGN LOAD
N opisuje wymaganie; „+1” lub „2N” opisuje zainstalowaną redundancję względem niego.
Zacznij od N
N to urządzenia lub moc potrzebne do obsługi obciążenia projektowego w określonych warunkach. Jeśli do obsłużenia sali potrzeba trzech jednostek chłodzących, N to trzy jednostki. Zainstalowanie tylko tych trzech daje projekt N: nie ma żadnej jednostki rezerwowej.
Definicja zależy od obciążenia, środowiska i założeń eksploatacyjnych. Cicha zmiana obciążenia potrafi zamienić wczorajszą instalację N+1 w dzisiejszą instalację N.
N+1 dodaje jedną sprawną jednostkę
N+1 oznacza wymaganą moc plus jedną dodatkową jednostkę odpowiedniej wielkości. Jeśli którakolwiek pojedyncza jednostka jest niedostępna, pozostałe nadal powinny przenieść obciążenie projektowe. Wspólne kolektory, układy sterowania, rozdzielnice czy tory rozdziału wciąż mogą być wspólnymi punktami awarii.
N+1 nie oznacza automatycznie kompletnego toru redundantnego. Zwykle opisuje moc komponentów w obrębie jednego systemu. Sprawdzaj topologię, a nie tylko liczbę pozycji w inwentarzu.
2N dubluje wymaganie
Projekt 2N obejmuje dwa kompletne zestawy, z których każdy sam obsłuży N. W prawdziwym projekcie od początku do końca tor A i tor B pozostają niezależne aż do odbioru. Dzięki temu jeden tor może przejść konserwację lub awarię, a drugi w tym czasie utrzymuje usługę.
Klasyfikacja Tier opisuje wyniki i topologię całego obiektu, a nie listę zakupów. Możliwość konserwacji bez wyłączania i odporność na awarie wymagają, żeby tę deklarację potwierdzał każdy istotny podsystem i każda procedura.
Odporność na awarie i konserwacja bez wyłączania to różne właściwości
Te dwa pojęcia są nieustannie mylone, a odpowiadają na różne pytania. Odporność na awarie pyta, czy obciążenie przetrwa nieplanowaną awarię. Możliwość konserwacji bez wyłączania pyta, czy zaplanowaną pracę – wymianę filtra, aktualizację firmware’u, przegląd wyłącznika – da się wykonać bez przerywania pracy obciążenia. Projekt może mieć jedną z tych cech bez drugiej.
To rozróżnienie ma znaczenie, bo planowane prace zdarzają się znacznie częściej niż awarie. Obiekt, który nie może wyłączyć elementu z eksploatacji bez okna serwisowego, będzie albo odkładał konserwację, albo kolekcjonował awarie – a jedno i drugie jest gorsze niż koszt zaprojektowania ścieżki konserwacji od samego początku. Gdy ktoś mówi, że system jest redundantny, warto dopytać: czy możesz wyłączyć ten element na cały dzień, celowo, w godzinach pracy?
Zapisz deklarację redundancji jednym zdaniem
Mgliste deklaracje redundancji przetrwają, bo nikt ich nie doprecyzowuje. Deklaracja, którą da się sprawdzić, ma pięć części: poziom redundancji, zestaw elementów, którego dotyczy, obsługiwane obciążenie, tor, którym biegnie, i to, co jest wprost wyłączone. Na przykład: N+1 na jednostkach chłodzących, pojedynczy tor na pętli wody lodowej, obsługa sali A, z wyłączeniem przyłącza sieciowego i systemu sterowania budynkiem.
Zapisany w ten sposób słaby punkt sam wychodzi na wierzch. Większość sal jakiś ma – to normalne i żaden skandal. Da się natomiast uniknąć sytuacji, w której nie wiesz, który to punkt, albo odkrywasz go podczas zdarzenia, a nie podczas przeglądu projektu. To ćwiczenie kosztuje jedno popołudnie i jest najtańszą pracą nad odpornością, jaka istnieje.
Jak to wygląda w Data Center Fan
Obecna wersja gry celowo upraszcza sprawę do liczby źródeł i zapasu. Laboratorium torów zasilania w Akademii idzie dalej: odsłania wspólne zależności po stronie zasilania, bo dwie skrzynki czy dwie etykiety nie dowodzą niezależnej obsługi.
Częste nieporozumienie
„Dwa urządzenia to 2N”. Dwie jednostki o połowie wymaganej mocy mogą razem dawać tylko N, a dwie jednostki zasilane z jednego źródła wciąż mogą zawieść jednocześnie.
Test wiedzy
Obciążenie wymaga trzech identycznych jednostek chłodzących. Zainstalowano cztery. Jaki to układ mocy komponentów?
- N+1
- 2N
- Tylko N
Trzy jednostki to N, a czwarta to ta jedna dodatkowa. O narażeniu na wspólne awarie i tak decyduje szersza topologia.
Najczęściej zadawane pytania
Co oznacza N+1?
N to moc faktycznie potrzebna do obsługi obciążenia. N+1 to dodatkowa jednostka tego samego rodzaju, dzięki której zestaw może stracić jedną jednostkę i nadal obsłużyć obciążenie. To stwierdzenie o zestawie komponentów, a nie o całym torze, w którym ten zestaw się znajduje.
Czym jest konserwacja bez wyłączania (concurrent maintainability)?
To możliwość wyłączenia zaplanowanego elementu lub toru z eksploatacji na czas konserwacji bez przerywania pracy obciążenia krytycznego. To coś innego niż odporność na awarie, która dotyczy przetrwania nieplanowanej awarii, i przydaje się częściej, bo planowane prace zdarzają się znacznie częściej niż awarie.
Co to jest pojedynczy punkt awarii?
Każdy element, tor lub wspólna zależność, których utrata odbiera usługę bez względu na to, ile redundantnego sprzętu jest dookoła. Typowe przykłady to wspólne przyłącze sieciowe za dwoma torami, jeden system sterowania nadzorujący oba albo dwa tory zasilania biegnące tą samą trasą kablową.
Czy redundancja poprawia dostępność?
Może, ale tylko wobec tych trybów awarii, które faktycznie obejmuje. Redundantna moc odpowiada na awarię komponentu; nie chroni przed błędem człowieka popełnionym na obu torach, przed wadą wspólną dla obu ani przed systemem pozostawionym po konserwacji w stanie obniżonej sprawności. Resztę ciężaru niosą eksploatacja i kontrola zmian.
Czym różni się układ redundantny od odpornego na awarie?
„Redundantny” opisuje zainstalowany zapas mocy. „Odporny na awarie” opisuje wynik – obciążenie pracuje dalej mimo zdefiniowanej awarii. Zapas, do którego obciążenie nie ma dostępu w chwili awarii, jest redundantny, ale nie daje odporności na awarie.
Czy więcej redundancji jest zawsze lepsze?
Nie. Każdy dodatkowy tor kosztuje kapitał, miejsce i energię, zmusza urządzenia do pracy przy niższym obciążeniu, przy którym często są mniej sprawne, i dokłada elementy oraz logikę sterowania, które same trzeba konserwować i testować. Właściwy poziom to taki, który odpowiada temu, co usługa musi przetrwać, i który organizacja jest w stanie faktycznie obsługiwać.