DCIM, BMS, alarmy i kontrola zmian
Opomiarowanie jest użyteczne tylko wtedy, gdy operatorzy ufają sygnałowi, znają jego właściciela i mogą działać kontrolowaną ścieżką.

Efekty nauki
- Rozdziel role BMS, EPMS, DCIM i monitoringu IT
- Zaprojektuj alarm, na który da się zareagować
- Stosuj kontrolę zmian, nie zamieniając jej w teatr papierologii
ALARM WYMAGAJĄCY DZIAŁANIA
SIGNAL + THRESHOLD + OWNER + RESPONSE + ESCALATION
Jeśli nikt nie wie, co zrobić, alarm jest tylko szumem ze znacznikiem czasu.
Różne systemy widzą różne warstwy
System zarządzania budynkiem (BMS) nadzoruje instalacje mechaniczne i automatykę budynku. System monitoringu zasilania (EPMS) skupia się na pomiarach i zdarzeniach elektrycznych. DCIM łączy informacje o pojemności, ewidencji sprzętu, warunkach środowiskowych i zasilaniu po stronie obiektu i IT. Monitoring IT obserwuje hosty, sieci, aplikacje i usługi.
Nazwy i granice produktów bywają różne. Model eksploatacji powinien określać źródło prawdy, synchronizację czasu, odpowiedzialność i przepływ danych między nimi.
Alarmuj o stanach, które wymagają działania
Alarm potrzebuje sensownego progu, reguły czasu trwania lub tempa zmian, poziomu ważności, właściciela, reakcji i eskalacji. Poziomy ostrzegawczy i krytyczny powinny zostawiać wystarczająco dużo czasu na działanie. Histereza (strefa nieczułości) i opóźnienia zapobiegają temu, że zaszumiona wartość raz po raz otwiera i zamyka alarm.
Przeglądaj uciążliwe alarmy i martwe punkty pomiarowe. Podczas incydentu kilka wiarygodnych sygnałów przyczynowych jest więcej wartych niż setki nieuporządkowanych objawów. Nigdy nie wyciszaj chronicznego alarmu bez usunięcia przyczyny albo formalnej akceptacji ryzyka.
Kontroluj zmianę, a potem wyciągaj z niej wnioski
Dobra karta zmiany określa cel, zakres, zależności, sposób weryfikacji, komunikację, plan wycofania i to, kto podejmuje decyzję. Rutynowe, wstępnie zatwierdzone zmiany mogą przechodzić lekką ścieżką; zmiany wysokiego ryzyka wymagają głębszego przeglądu i okna serwisowego zgodnego ze zobowiązaniami wobec usług.
Po incydencie zbuduj oś czasu z zsynchronizowanych dowodów. Oddziel warunki sprzyjające od zdarzenia wyzwalającego, przypisz trwałe działania i sprawdź, czy każde z nich faktycznie zmniejsza prawdopodobieństwo lub skutki.
Zmęczenie alarmami to wada projektu, a nie błąd operatora
Gdy na konsoli wiszą setki stałych alarmów, ludzie przestają ją czytać – i zachowują się racjonalnie, bo konsola przestała nieść informację. Zawiódł projekt alarmów, a nie uwaga osoby, która je obserwuje. System, w którym wszystko jest alarmem, niesie tyle samo informacji co system, w którym nic nim nie jest.
Rozwiązania są mało efektowne, za to skuteczne: wycofaj alarmy, do których nie ma przypisanej reakcji, ustaw progi według tego, co naprawdę wymaga działania, a nie tego, co jest jedynie nietypowe, usuwaj duplikaty z kaskady po jednym zdarzeniu pierwotnym, wyciszaj alarmy, które znana planowana praca nieuchronnie wywoła, i przeglądaj stałe alarmy według harmonogramu, żeby lista nie mogła po cichu znów urosnąć. Alarm bez właściciela i reakcji to powiadomienie i tak powinien być oznaczony.
Jak wyglądają dobre dowody po zdarzeniu
Wartość monitoringu ujawnia się głównie wtedy, gdy coś pójdzie nie tak, a zależy od decyzji podjętych dużo wcześniej. Jedną oś czasu umożliwiają dopiero zegary zsynchronizowane między systemami obiektu i IT; bez nich powiązanie zadziałania wyłącznika z awarią usługi staje się zgadywaniem. Dane trendów przechowywane w przydatnej rozdzielczości pozwalają zobaczyć godzinę przed zdarzeniem, a nie tylko jego moment.
Jest też różnica między logiem a rejestrem. Log to to, co system akurat wyemitował. Rejestr to coś przechowywanego celowo, ze znanym okresem retencji, co można później przedstawić i na czym można polegać – zgłoszenia zmian, sekwencje sterowania, wyniki rozruchu i odbiorów, historia konserwacji. Przeglądy poincydentalne, które wciąż kończą się niejasnościami, zwykle mają problem z dowodami, a nie z diagnozą.
Jak to wygląda w Data Center Fan
Ostrzeżenia, wybory przy zdarzeniach, łańcuchy incydentów, cele i prognozy zamieniają monitoring w decyzje. Gra pokazuje, jaka akcja zostanie wykonana domyślnie po upływie czasu, więc zignorowanie alarmu samo w sobie jest jawną decyzją operacyjną.
Częste nieporozumienie
„Więcej alarmów to lepsze pokrycie”. Więcej alarmów, na które nie da się zareagować, osłabia uwagę i może ukryć pierwszy sygnał, który miał znaczenie.
Test wiedzy
Na który alarm najłatwiej sensownie zareagować?
- Wlot szafy powyżej limitu od 3 minut; podlinkowany właściciel i runbook
- Zmieniła się temperatura
- Ostrzeżenie systemowe 8472
Określa mierzony stan, czas jego trwania i odpowiedzialność za reakcję, zamiast zgłaszać niewyjaśniony objaw.
Najczęściej zadawane pytania
Co to jest DCIM?
Zarządzanie infrastrukturą centrum danych (data center infrastructure management): narzędzia, które łączą informacje o pojemności obiektu, warunkach środowiskowych, zasilaniu i sprzęcie, tak żeby miejsce, moc, chłodzenie i urządzenia można było planować i śledzić razem, a nie w osobnych arkuszach kalkulacyjnych.
Co to jest BMS?
System zarządzania budynkiem (building management system), który nadzoruje automatykę budynku i instalacji mechanicznych, punkty, trendy i alarmy. To system, który wie, co robi instalacja chłodnicza, i zwykle jest odrębny zarówno od systemu monitoringu elektrycznego, jak i od monitoringu IT.
Czym różni się DCIM od BMS?
BMS steruje systemami budynku i je nadzoruje; DCIM zarządza pojemnością, sprzętem i danymi środowiskowymi centrum danych na potrzeby planowania i eksploatacji. Częściowo potrafią wyświetlać to samo, ale odpowiadają na różne pytania i zwykle należą do różnych zespołów.
Co to jest EPMS?
System monitoringu zasilania elektrycznego (electrical power monitoring system): pomiary, rejestracja zdarzeń i analiza dla układu rozdziału energii. To system, który powie, co naprawdę wydarzyło się elektrycznie podczas zdarzenia i w jakiej kolejności – pod warunkiem że jego zegary zgadzają się ze wszystkimi innymi.
Co to jest zmęczenie alarmami?
Stan, w którym aktywnych alarmów jest tak wiele albo tak wiele z nich nic nie znaczy, że ludzie przestają traktować je jak sygnały. Powoduje go projekt alarmów – progi ustawione na to, co nietypowe, a nie na to, co wymaga działania, nieodfiltrowane kaskady, nigdy niewycofane stałe alarmy – a naprawia się go, przeprojektowując alarmy, a nie apelując o większą czujność.
Czym jest kontrola zmian w centrum danych?
Proces proponowania, przeglądu, planowania, wykonywania i rejestrowania zmian w obiekcie i jego systemach, z określonym planem wycofania. Jego celem jest utrzymanie zgodności stanu zainstalowanego ze stanem udokumentowanym, tak żeby następną osobę pracującą przy systemie nic nie zaskoczyło.