Rozwiązania · Monitoring sprzętu out-of-band

    Monitoring Supermicro IPMI, Bezagentowa kondycja BMC w skali całej floty

    Sprzęt Supermicro jest powszechny w gęstych środowiskach obliczeniowych, GPU i flotach w stylu hyperscale, gdzie wbudowany BMC jest często jedyną spójną ścieżką zarządzania. Monitoring Supermicro w Sensaka odczytuje ten BMC bezagentowo i włącza te serwery do jednego widoku kondycji, wspólnego dla wszystkich producentów.

    Zbieranie danych odbywa się przez sieć zarządzającą za pomocą IPMI i Redfish, dzięki czemu awarie zasilania, termiczne i pamięci są wykrywane wcześnie, a węzły pozostają widoczne podczas awarii systemu operacyjnego, zawieszenia lub zdarzenia zasilania — co ma szczególne znaczenie w szafach o wysokiej gęstości i szafach GPU.

    Zakres

    Co Sensaka monitoruje w Supermicro IPMI / Redfish

    IPMI / Redfish (Supermicro BMC) to kontroler zarządzania płytą główną (BMC) firmy Supermicro. Sensaka DCOS łączy się z nim bezagentowo przez IPMI i Redfish i odczytuje kondycję sprzętu bezpośrednio z kontrolera.

    Kondycja zasilaczy, redundancja i odczyty mocy
    Prędkość wentylatorów, awarie wentylatorów i stan termiczny
    Temperatury powietrza wlotowego i podzespołów
    Błędy i stan pamięci DIMM
    Kondycja dysków i kontrolera pamięci masowej, tam gdzie jest udostępniana
    Stan CPU i wykrycie otwarcia obudowy
    Wpisy dziennika zdarzeń systemowych BMC (SEL)
    Dostępność BMC i ogólne podsumowanie czujników
    Dlaczego out-of-band

    Widoczność sprzętu, która przetrwa awarię systemu operacyjnego

    Widoczność niezależna od systemu operacyjnego

    Kontroler działa na dedykowanym sprzęcie zarządzającym, dzięki czemu dane o kondycji są dostępne nawet wtedy, gdy system operacyjny ulegnie awarii, zawiesi się lub straci sieć produkcyjną.

    Awarie na poziomie podzespołów

    CPU, błędy korygowalne i niekorygowalne DIMM, stan zasilaczy, prędkość i awarie wentylatorów, kondycja RAID i dysków oraz temperatura powietrza wlotowego.

    Jeden widok dla wszystkich producentów

    Znormalizowane do tego samego modelu co reszta floty, dzięki czemu ten sprzęt nie wymaga osobnej konsoli.

    Operacje zdalne

    Restart zasilania, zdalna konsola i akcje wsadowe przez sieć zarządzającą — dla lokalizacji typu lights-out i zdalnego rozwiązywania problemów.

    Firmware i kontekst zmian

    Wersje firmware i punkty odniesienia konfiguracji śledzone razem z alertami, łączące zmiany sprzętowe z incydentami i potrzebami audytowymi.

    Mapowanie wpływu na usługi

    Awarie powiązane z usługami biznesowymi zależnymi od danego węzła, dzięki czemu krytyczny sprzęt jest odpowiednio priorytetyzowany.

    Specyfika Supermicro

    Uwagi dotyczące monitorowania Supermicro IPMI / Redfish na dużą skalę

    Dobrze sprawdza się w dużych flotach Supermicro i white-box, gdzie pakiety zarządzania producenta są minimalne.
    Wykorzystuje Redfish na nowszych płytach oraz szeroko IPMI, obejmując zarówno starsze, jak i nowsze generacje Supermicro.
    Szczególnie przydatne w gęstych obudowach GPU i AI, gdzie awarie termiczne i zasilania rozwijają się szybko.
    Normalizuje czujniki Supermicro do tego samego modelu co sprzęt Dell, HPE, Lenovo i Huawei.

    Supermicro IPMI / Redfish to jedna warstwa środowiska wielodostawcowego. To samo podejście zasila monitoring BMC wielu producentów w całej flocie, zasilając zunifikowaną platformę iDCOS oraz SmartBSM pod kątem wpływu na usługi biznesowe.

    Dokumentacja protokołów: Redfish (DMTF) oraz specyfikacja IPMI.

    FAQ

    Monitoring Supermicro IPMI / Redfish — odpowiedzi na pytania

    Sensaka DCOS łączy się z wbudowanym BMC każdego serwera Supermicro przez sieć zarządzającą, wykorzystując IPMI i Redfish. Odczytuje czujniki, dziennik zdarzeń systemowych oraz kondycję podzespołów bezpośrednio z BMC, dzięki czemu agent na hoście nie jest wymagany.

    Tak. Sensaka szeroko wykorzystuje IPMI dla starszych płyt oraz Redfish tam, gdzie jest dostępny w nowszych generacjach, zapewniając spójne pokrycie w mieszanych flotach Supermicro.

    Szczególnie. Gęste obudowy GPU i AI są wrażliwe na szybko rozwijające się awarie zasilania i termiczne, a bezagentowy monitoring BMC nadal raportuje dane nawet wtedy, gdy węzeł zawiesi się lub wypadnie z klastra. Widok obciążeń znajduje się w monitoringu infrastruktury GPU.

    Degradację i utratę redundancji zasilaczy, awarie wentylatorów i problemy termiczne, błędy pamięci DIMM, awarie dysków i pamięci masowej tam, gdzie są udostępniane, zdarzenia CPU oraz wykrycie otwarcia obudowy, a także wpisy z dziennika SEL BMC.

    DCOS zapewnia bezagentowy monitoring out-of-band sprzętu Supermicro. Zasila zunifikowaną platformę iDCOS, a SmartBSM dodaje funkcje AIOps i mapowanie usług biznesowych, dzięki czemu awarie BMC są powiązane z wpływem na usługi.
    Rozpocznij

    Monitorowanie sprzętu Supermicro bez agenta

    DCOS bezagentowo odczytuje kondycję IPMI / Redfish i łączy ją w jeden widok obejmujący całą flotę, niezależnie od producenta.