Rozwiązania · monitoring sprzętu i out-of-band

    Monitoring BMC wielu producentów — jeden widok kondycji dla każdego serwera

    Dla zespołów infrastruktury zarządzających flotą urządzeń różnych producentów każdy serwer ma już własny moduł Baseboard Management Controller, jednak każdy producent udostępnia go przez inną konsolę. Monitoring BMC odczytuje kondycję sprzętu bezpośrednio z tych kontrolerów i normalizuje ją do jednego modelu, dzięki czemu awarie na poziomie komponentów są wykrywane wcześnie, a serwery pozostają widoczne nawet wtedy, gdy system operacyjny nie działa.

    Sensaka DCOS realizuje to w sposób bezagentowy przez Redfish, IPMI, iDRAC, iLO i iBMC. Działa w dedykowanej sieci zarządzającej, dzięki czemu widoczność sprzętu nigdy nie zależy od systemu operacyjnego środowiska produkcyjnego ani zainstalowanego agenta.

    Problem

    Awarie sprzętu ukrywają się poniżej systemu operacyjnego i w konsolach różnych producentów

    Każdy producent sprzętu dostarcza własną konsolę BMC, przez co brakuje jednego, ujednoliconego widoku kondycji floty urządzeń różnych producentów.
    Narzędzia oparte na systemie operacyjnym i SNMP nie wykrywają awarii na poziomie komponentów, takich jak błędy DIMM, degradacja zasilaczy czy awarie wentylatorów, dopóki nie doprowadzą do awarii.
    Gdy serwer przestaje działać, monitoring wewnątrz systemu operacyjnego milknie dokładnie w momencie, gdy zespół najbardziej potrzebuje widoczności sprzętu.
    Ręczna inspekcja nie jest w stanie nadążyć za tysiącami urządzeń rozproszonych w wielu lokalizacjach.
    Protokoły i producenci

    Bezagentowo, zgodnie ze standardami już obecnymi w infrastrukturze

    Redfish

    Nowoczesne API REST do monitorowania i zarządzania kondycją sprzętu serwerowego

    IPMI

    Starszy standard do obsługi czujników, zasilania i sterowania obudową

    iDRAC

    BMC serwerów Dell

    iLO

    BMC serwerów HPE

    iBMC

    BMC serwerów Huawei

    XCC / others

    Kontrolery Lenovo i innych producentów

    Możliwości

    Co zapewnia monitoring BMC z DCOS

    Kondycja na poziomie komponentów

    CPU, błędy DIMM możliwe i niemożliwe do skorygowania, stan zasilaczy, prędkość obrotowa i awarie wentylatorów, kondycja RAID i dysków oraz temperatura wlotowa — odczytywane bezpośrednio z kontrolera.

    Widoczność niezależna od systemu operacyjnego

    Ponieważ BMC działa na dedykowanym sprzęcie zarządzającym, monitoring działa dalej, nawet gdy system operacyjny ulega awarii, zawiesza się lub serwer traci łączność z siecią produkcyjną.

    Jeden widok dla wszystkich producentów

    Dell, HPE, Lenovo, Cisco, Huawei, Supermicro i inni raportują do jednego modelu kondycji zamiast osobnej konsoli producenta dla każdej floty urządzeń.

    Operacje zdalne

    Restart zasilania, dostęp przez vKVM oraz akcje wsadowe przez sieć zarządzającą — dla lokalizacji bezobsługowych i zdalnego rozwiązywania problemów.

    Kontekst oprogramowania układowego i zmian

    Wersje oprogramowania układowego i punkty odniesienia konfiguracji śledzone razem z alertami, dzięki czemu zmiany sprzętowe są powiązane z incydentami i potrzebami audytowymi.

    Mapowanie wpływu na usługi

    Awarie sprzętu powiązane z usługami biznesowymi, które wspierają, dzięki czemu degradacja zasilacza na krytycznym węźle jest odpowiednio priorytetyzowana.

    Miejsce w platformie

    Od kontrolera do wpływu na usługi biznesowe

    Monitoring BMC to fundament warstwy fizycznej. DCOS odpowiada za tę warstwę, odczytując dane z kontrolerów w sposób bezagentowy i zachowując widoczność, gdy system operacyjny jest nieosiągalny. Naturalnie łączy się z szerszym monitoringiem out-of-band oraz monitoringiem sprzętu wielu producentów.

    Następnie iDCOS ujednolica telemetrię sprzętową z danymi logicznymi i operacyjnymi, a SmartBSM mapuje awarie na usługi biznesowe, które od nich zależą. W gęstych środowiskach akceleratorów ta sama warstwa BMC zasila monitoring infrastruktury GPU. Dla osób poznających to zagadnienie po raz pierwszy dostępna jest definicja monitoringu BMC.

    Według kontrolera producenta: Dell iDRAC, HPE iLO, Huawei iBMC, Lenovo XCC oraz Supermicro IPMI.

    Standardy: Redfish (DMTF) oraz specyfikacja IPMI.

    FAQ

    Najczęstsze pytania o monitoring BMC

    Monitoring BMC zbiera dane o kondycji sprzętu i telemetrię bezpośrednio z modułu Baseboard Management Controller każdego serwera, niezależnie od systemu operacyjnego. Zespoły enterprise wykorzystują go do wczesnego wykrywania awarii na poziomie komponentów, takich jak błędy DIMM, degradacja zasilaczy, awarie wentylatorów i rosnąca temperatura wlotowa, a także do monitorowania i sterowania serwerami nawet wtedy, gdy system operacyjny nie działa.

    Sensaka DCOS monitoruje sprzęt w sposób bezagentowy przez Redfish, IPMI oraz kontrolery producentów, w tym Dell iDRAC, HPE iLO, Huawei iBMC i Lenovo XCC, a tam gdzie to zasadne — również przez SNMP i API, zapewniając jeden widok kondycji w środowiskach wielu producentów.

    Monitoring oparty na agentach działa wewnątrz systemu operacyjnego i przestaje raportować, gdy system jest niedostępny. Monitoring BMC działa na dedykowanym sprzęcie zarządzającym out-of-band, dzięki czemu nadal zbiera telemetrię i może sterować serwerem podczas awarii, utraty zasilania czy izolacji sieciowej. Oba podejścia się uzupełniają, ale tylko out-of-band widzi to, co dzieje się poniżej systemu operacyjnego.

    Tak. DCOS jest neutralny względem producentów. Normalizuje telemetrię z kontrolerów Dell, HPE, Lenovo, Cisco, Huawei, Supermicro i innych do jednego modelu, dzięki czemu zespoły zarządzają zróżnicowaną flotą urządzeń z poziomu jednej platformy zamiast osobnych narzędzi poszczególnych producentów.

    DCOS zapewnia bezagentowy monitoring BMC out-of-band dla infrastruktury fizycznej. Zasila zunifikowaną platformę iDCOS, a SmartBSM dodatkowo wprowadza AIOps i mapowanie usług biznesowych, dzięki czemu awarie sprzętu są powiązane z wpływem na usługi.

    Tak. Definicje, protokoły i przypadki użycia można znaleźć w haśle słownikowym dotyczącym monitoringu BMC. Ta strona koncentruje się na tym, jak monitoring BMC wielu producentów jest realizowany w operacjach centrów danych klasy enterprise.
    Rozpocznij

    Jedna platforma dla warstwy sprzętowej każdego serwera

    Widać, jak DCOS monitoruje kondycję BMC we flotach urządzeń różnych producentów i zasila nią zunifikowane operacje w iDCOS i SmartBSM.

    Dokumentacja techniczna: Przewodnik referencyjny poleceń DMTF Redfish i IPMI 2.0 zawiera surowe punkty końcowe schematu oraz mapowanie OID czujników.