Sensaka – platforma zarządzania operacjami centrum danych AI

    CMDB infrastruktury AI i analiza wpływu

    Każdy obiekt, GPU, obciążenie, usługa i właściciel — połączone w jednym modelu.

    Sensaka – CMDB infrastruktury AI zastępuje rozłączone listy zasobów żywym modelem relacji dla operacji centrum danych AI. Łączy infrastrukturę fizyczną, zasoby obliczeniowe, działania operacyjne, ludzi i usługi biznesowe, dzięki czemu zespoły rozumieją, czym jest dany zasób, gdzie się znajduje, co obsługuje, kto jest jego właścicielem i co może zostać dotknięte w razie awarii.

    Problem

    Statyczna lista zasobów nie wyjaśnia infrastruktury AI

    Tradycyjne rejestry zasobów zapisują urządzenia, numery seryjne i lokalizacje. Operacje infrastruktury AI wymagają szerszego i bardziej dynamicznego spojrzenia.

    Pojedyncze GPU może być częścią serwera fizycznego, przypisane do puli zasobów, przydzielone kontenerowi, wykorzystywane przez obciążenie związane z trenowaniem lub wnioskowaniem, powiązane z projektem i połączone z usługą używaną przez zespół biznesowy.

    Gdy te relacje są utrzymywane w osobnych narzędziach, operatorom trudno jest odpowiedzieć na podstawowe pytania podczas incydentu:

    Które obciążenie korzysta z tego GPU?
    Która usługa modelu działa na tym węźle?
    Na który projekt i dział wpłynie ten problem?
    Kto jest właścicielem usługi i kto powinien zareagować?
    Co się zmieniło, zanim pojawił się problem?

    Sensaka buduje kontekst relacji potrzebny do odpowiedzi na te pytania.

    Model danych

    Pięć wymiarów operacji centrum danych AI w jednym modelu

    CMDB Sensaka porządkuje infrastrukturę AI wokół pięciu powiązanych wymiarów.

    Ludzie

    Rejestrowanie odpowiedzialnych właścicieli, zespołów operacyjnych, dzierżawców, dostawców, ról i uprawnień. Powiązanie infrastruktury i usług z osobami za nie odpowiedzialnymi.

    Infrastruktura fizyczna

    Zarządzanie obiektami, pomieszczeniami, szafami rack, jednostkami rack, serwerami, kartami akceleratorów, sieciami, systemami pamięci masowej, sprzętem zasilającym i infrastrukturą chłodzenia cieczą.

    Działania operacyjne

    Powiązanie działań związanych z szeregowaniem zadań, obciążeń związanych z trenowaniem i wnioskowaniem, alarmów, zgłoszeń serwisowych, zmian, inspekcji i rejestrów konserwacji.

    Zasoby obliczeniowe

    Modelowanie klastrów, węzłów, pul zasobów, specyfikacji, limitów, przydzielonej pojemności i dostępnej pojemności.

    Usługi biznesowe

    Powiązanie usług modeli, instancji wnioskowania, aplikacji, agentów, projektów i działów biznesowych z infrastrukturą, którą wykorzystują.

    Razem te pięć wymiarów tworzy model operacyjny bardziej użyteczny niż sama inwentaryzacja urządzeń.

    Aktualność danych

    Automatyczne utrzymywanie aktualnych danych o infrastrukturze

    Infrastruktura AI zmienia się nieustannie. Instalowany jest nowy sprzęt, wymieniane są karty akceleratorów, obciążenia są przenoszone, kontenery są restartowane, a przydziały zasobów ulegają zmianie.

    Sensaka wykorzystuje wykrywanie infrastruktury i synchronizację konfiguracji, aby ograniczyć zależność od ręcznych aktualizacji. Obsługiwane interfejsy urządzeń, BMC, Kubernetes i infrastruktury mogą dostarczać aktualne dane o konfiguracji i relacjach. Platforma może rejestrować:

    Inwentaryzacja urządzeń i komponentów
    Model, liczba i lokalizacja węzła kart GPU i NPU
    Lokalizacja obiektu, szafy rack i jednostki rack
    Przynależność do klastra, węzła i puli zasobów
    Przydział obciążeń, kontenerów i akceleratorów
    Powiązanie z projektem, dzierżawcą i właścicielem
    Zmiany konfiguracji i historia operacyjna

    Reguły nadrzędności źródeł i sposób rozwiązywania konfliktów należy ustalić na etapie wdrożenia, aby zespoły wiedziały, które źródło jest wiarygodne, gdy automatyczne wykrywanie i ręczne rekordy się różnią.

    Graf relacji

    Wspólne zarządzanie relacjami fizycznymi i logicznymi

    Infrastruktura AI obejmuje zarówno fizyczne, jak i logiczne łańcuchy zależności.

    Relacje fizyczne

    Obiekt, szafa rack, serwer, slot, akcelerator, port sieciowy, połączenie pamięci masowej, ścieżka zasilania i lokalizacja chłodzenia.

    Relacje logiczne

    Klaster, pula zasobów, kontener, obciążenie, usługa modelu, aplikacja, projekt i właściciel.

    Sensaka gromadzi te relacje we wspólnym grafie, dzięki czemu operatorzy mogą przechodzić między widokiem fizycznym a logicznym tej samej usługi. Przykładowo, operator może zacząć od spowolnionej usługi wnioskowania, zlokalizować jej instancję i kontener, zidentyfikować GPU i węzeł, przeanalizować zależności sieciowe i związane z pamięcią masową, a następnie sprawdzić fizyczny serwer i kondycję sprzętu.

    Analiza wpływu

    Zrozumienie wpływu biznesowego przed podjęciem działania

    Gdy akcelerator, węzeł lub komponent infrastruktury zgłasza problem, Sensaka może wykorzystać graf relacji, aby pomóc określić prawdopodobny zasięg wpływu.

    Spojrzenie w górę: usługi i kontekst biznesowy

    Identyfikacja dotkniętych usług modeli, instancji wnioskowania, aplikacji, projektów i działów biznesowych. Tam, gdzie zarejestrowano zobowiązania dotyczące usług, widok wpływu może uwzględniać odpowiedni kontekst poziomu usług.

    Spojrzenie w dół: dowody z infrastruktury

    Przegląd statusu akceleratorów, węzłów i komponentów, a następnie korelacja danych o sieci, pamięci masowej, temperaturze i kondycji sprzętu związanych ze zdarzeniem.

    Spojrzenie w bok: odpowiedzialność i przepływ pracy

    Identyfikacja odpowiedzialnego właściciela lub zespołu operacyjnego oraz utworzenie zgłoszenia z dołączonymi dotkniętymi obiektami i kontekstem analizy.

    Dzięki temu przejście od alarmu infrastrukturalnego do odpowiedzi operacyjnej uwzględniającej kontekst biznesowy staje się bardziej przejrzyste.

    Historia zmian

    Śledzenie zmian i odtwarzanie przeszłych stanów

    Zmiany konfiguracji mogą wyjaśniać problemy z wydajnością i awarie, ale tylko wtedy, gdy dostępna jest ich historia. Sensaka rejestruje zmiany wraz z poprzednią i nową wartością, operatorem lub źródłem wykrycia oraz czasem obowiązywania. Migawki historyczne pomagają zespołom odtworzyć stan zasobu i jego relacji sprzed danego momentu.

    Analiza incydentów Analiza dryfu konfiguracji Przegląd audytowy i zgodności Walidacja zmian Planowanie pojemności i cyklu życia Porównanie stanu infrastruktury przed zdarzeniem i po nim
    Typowe przypadki użycia

    Gdzie sprawdza się CMDB infrastruktury AI

    Analiza wpływu awarii GPU

    Punktem wyjścia jest alarm akceleratora. Identyfikacja węzła, kontenera, obciążenia, usługi modelu, projektu i właściciela powiązanych z dotkniętą kartą. Przegląd powiązanych danych o temperaturze, zasilaniu, ECC, sieci i pamięci masowej przed przypisaniem odpowiedzi.

    Analiza spowolnionej usługi wnioskowania

    Punktem wyjścia jest dotknięta usługa, a analiza przebiega w dół — przez instancję, kontener, GPU i węzeł fizyczny. Ustalenie, czy degradacja usługi jest powiązana z warunkami dotyczącymi zasobów, sprzętu lub infrastruktury.

    Uzgadnianie zasobów infrastruktury AI

    Porównanie wykrytej konfiguracji serwerów i akceleratorów z rekordem CMDB. Identyfikacja brakujących zasobów, zmian konfiguracji lub niespójności lokalizacji.

    Przegląd zmian i audytu

    Sprawdzenie, kto zmienił zasób lub relację, kiedy nastąpiła zmiana i w jaki sposób została wykryta. Odtworzenie stanu konfiguracji z chwili wystąpienia incydentu.

    Mapowanie odpowiedzialności

    Powiązanie klastrów, pul zasobów, projektów i usług z właścicielami oraz zespołami operacyjnymi, dzięki czemu incydenty można kierować bez przeszukiwania osobnych list kontaktowych.

    Przekazanie z wdrożenia do operacji

    Po uruchomieniu serwera następuje jego rejestracja w CMDB, dodanie do monitoringu oraz powiązanie z właściwym obiektem, klastrem i relacjami zasobów.

    Kluczowe funkcje

    Wszystko, czego potrzebuje model relacji

    Modelowanie ludzi, infrastruktury fizycznej, działań, zasobów obliczeniowych i biznesu
    Automatyczne wykrywanie i synchronizacja konfiguracji
    Inwentaryzacja GPU i NPU na poziomie komponentów
    Zarządzanie obiektami, szafami rack i jednostkami rack
    Graf relacji fizycznych i logicznych
    Mapowanie obciążeń, kontenerów, GPU i węzłów
    Powiązanie projektu, dzierżawcy, usługi i właściciela
    Historia zmian i odtwarzanie stanów historycznych
    Analiza wpływu na usługi i biznes (spojrzenie w górę)
    Analiza infrastruktury i sprzętu (spojrzenie w dół)
    Mapowanie odpowiedzialności i tworzenie zgłoszeń serwisowych
    Integracja z monitoringiem, szeregowaniem zadań, pomiarem zużycia i procesami operacyjnymi — w zakresie ustalonym dla danego projektu
    Dlaczego Sensaka

    Dogłębna widoczność infrastruktury fizycznej — wbudowana

    Sensaka łączy funkcje CMDB z dogłębną widocznością infrastruktury fizycznej. Platforma może wykorzystywać interfejsy zarządzania urządzeniami, dane BMC, telemetrię akceleratorów, informacje z Kubernetes, dane sieciowe i rejestry operacyjne, aby model pozostawał połączony z działającym środowiskiem.

    Ma to szczególne znaczenie w centrach danych AI, ponieważ łańcuch zależności obejmuje obiekty, sprzęt, platformy programowe i usługi biznesowe. Model relacji zbudowany wyłącznie na danych z chmury lub aplikacji może pomijać kontekst komponentów fizycznych, zasilania, chłodzenia i lokalizacji potrzebny do pełnej analizy wpływu.

    Zasady wdrożenia

    Użyteczne CMDB zależy od ładu organizacyjnego w takim samym stopniu, co od technologii

    Na etapie wdrożenia Sensaka i klient powinni wspólnie określić:

    01Typy elementów konfiguracji i wymagane atrybuty
    02Unikalne identyfikatory obiektów, urządzeń, komponentów i usług
    03Zaufane źródła danych i reguły rozwiązywania konfliktów
    04Pola własności i odpowiedzialności
    05Reguły wykrywania i utrzymania relacji
    06Wymogi dotyczące przechowywania zmian i audytu
    07Etykiety poziomu usług i wpływu biznesowego
    08Granice integracji z istniejącymi systemami CMDB, ITSM i monitoringu
    FAQ

    Najczęściej zadawane pytania

    Czym CMDB infrastruktury AI różni się od tradycyjnego CMDB?

    Obejmuje karty akceleratorów, klastry, pule zasobów, kontenery, obciążenia AI, usługi modeli oraz ich relacje z fizyczną infrastrukturą centrum danych. Musi odzwierciedlać zarówno szybko zmieniające się przydziały logiczne, jak i długotrwałe zasoby fizyczne.

    Czy Sensaka może automatycznie wykrywać GPU?

    Sensaka może zbierać dane inwentaryzacyjne akceleratorów oraz relacje węzłów z obsługiwanych interfejsów sprzętowych i programowych. Dokładny zakres pól i częstotliwość aktualizacji zależą od dostępnych producentów i interfejsów zarządzania.

    Czy CMDB zastępuje istniejące firmowe CMDB?

    Może działać jako podstawa danych dla infrastruktury AI lub integrować się z istniejącym firmowym CMDB. Właściwa architektura zależy od własności danych, granic systemów i obecnych procesów klienta.

    Czy platforma może wskazać, która usługa biznesowa jest dotknięta awarią GPU?

    Tak, gdy wymagane relacje od GPU przez węzeł, obciążenie, usługę modelu i projekt aż po usługę biznesową są kompletne. Jakość analizy wpływu zależy od kompletności i dokładności tych relacji.

    Czy można przeglądać historyczne konfiguracje?

    Sensaka obsługuje historię zmian oraz odtwarzanie stanów z określonego momentu dla zarządzanych danych konfiguracyjnych. Okres przechowywania i poziom szczegółowości należy ustalić na etapie wdrożenia.

    Czy analiza wpływu może utworzyć zgłoszenie ITSM?

    Sensaka może przypisać odpowiedzialny zespół i zainicjować zgłoszenie serwisowe za pośrednictwem dostępnego procesu lub integracji ITSM. Dokładny sposób przekierowywania i zatwierdzania jest konfigurowany dla środowiska klienta.

    Rozpocznij

    Dane o infrastrukturze zamienione w kontekst operacyjny

    Pełna wiedza o tym, co obsługuje każdy zasób, kto jest jego właścicielem i co zostanie dotknięte, zanim podjęte zostanie kolejne działanie.

    Powiązane: Obserwowalność infrastruktury AI, Pomiar zużycia GPU, Monitoring chłodzenia cieczą