Monitoring BMC wielu producentów — jeden widok kondycji dla każdego serwera
Dla zespołów infrastruktury zarządzających flotą urządzeń różnych producentów każdy serwer ma już własny moduł Baseboard Management Controller, jednak każdy producent udostępnia go przez inną konsolę. Monitoring BMC odczytuje kondycję sprzętu bezpośrednio z tych kontrolerów i normalizuje ją do jednego modelu, dzięki czemu awarie na poziomie komponentów są wykrywane wcześnie, a serwery pozostają widoczne nawet wtedy, gdy system operacyjny nie działa.
Sensaka DCOS realizuje to w sposób bezagentowy przez Redfish, IPMI, iDRAC, iLO i iBMC. Działa w dedykowanej sieci zarządzającej, dzięki czemu widoczność sprzętu nigdy nie zależy od systemu operacyjnego środowiska produkcyjnego ani zainstalowanego agenta.
Awarie sprzętu ukrywają się poniżej systemu operacyjnego i w konsolach różnych producentów
Bezagentowo, zgodnie ze standardami już obecnymi w infrastrukturze
Nowoczesne API REST do monitorowania i zarządzania kondycją sprzętu serwerowego
Starszy standard do obsługi czujników, zasilania i sterowania obudową
BMC serwerów Dell
BMC serwerów HPE
BMC serwerów Huawei
Kontrolery Lenovo i innych producentów
Co zapewnia monitoring BMC z DCOS
Kondycja na poziomie komponentów
CPU, błędy DIMM możliwe i niemożliwe do skorygowania, stan zasilaczy, prędkość obrotowa i awarie wentylatorów, kondycja RAID i dysków oraz temperatura wlotowa — odczytywane bezpośrednio z kontrolera.
Widoczność niezależna od systemu operacyjnego
Ponieważ BMC działa na dedykowanym sprzęcie zarządzającym, monitoring działa dalej, nawet gdy system operacyjny ulega awarii, zawiesza się lub serwer traci łączność z siecią produkcyjną.
Jeden widok dla wszystkich producentów
Dell, HPE, Lenovo, Cisco, Huawei, Supermicro i inni raportują do jednego modelu kondycji zamiast osobnej konsoli producenta dla każdej floty urządzeń.
Operacje zdalne
Restart zasilania, dostęp przez vKVM oraz akcje wsadowe przez sieć zarządzającą — dla lokalizacji bezobsługowych i zdalnego rozwiązywania problemów.
Kontekst oprogramowania układowego i zmian
Wersje oprogramowania układowego i punkty odniesienia konfiguracji śledzone razem z alertami, dzięki czemu zmiany sprzętowe są powiązane z incydentami i potrzebami audytowymi.
Mapowanie wpływu na usługi
Awarie sprzętu powiązane z usługami biznesowymi, które wspierają, dzięki czemu degradacja zasilacza na krytycznym węźle jest odpowiednio priorytetyzowana.
Od kontrolera do wpływu na usługi biznesowe
Monitoring BMC to fundament warstwy fizycznej. DCOS odpowiada za tę warstwę, odczytując dane z kontrolerów w sposób bezagentowy i zachowując widoczność, gdy system operacyjny jest nieosiągalny. Naturalnie łączy się z szerszym monitoringiem out-of-band oraz monitoringiem sprzętu wielu producentów.
Następnie iDCOS ujednolica telemetrię sprzętową z danymi logicznymi i operacyjnymi, a SmartBSM mapuje awarie na usługi biznesowe, które od nich zależą. W gęstych środowiskach akceleratorów ta sama warstwa BMC zasila monitoring infrastruktury GPU. Dla osób poznających to zagadnienie po raz pierwszy dostępna jest definicja monitoringu BMC.
Według kontrolera producenta: Dell iDRAC, HPE iLO, Huawei iBMC, Lenovo XCC oraz Supermicro IPMI.
Standardy: Redfish (DMTF) oraz specyfikacja IPMI.
Najczęstsze pytania o monitoring BMC
Jedna platforma dla warstwy sprzętowej każdego serwera
Widać, jak DCOS monitoruje kondycję BMC we flotach urządzeń różnych producentów i zasila nią zunifikowane operacje w iDCOS i SmartBSM.
Dokumentacja techniczna: Przewodnik referencyjny poleceń DMTF Redfish i IPMI 2.0 zawiera surowe punkty końcowe schematu oraz mapowanie OID czujników.
