CMDB infrastruktury AI i analiza wpływu
Każdy obiekt, GPU, obciążenie, usługa i właściciel — połączone w jednym modelu.
Sensaka – CMDB infrastruktury AI zastępuje rozłączone listy zasobów żywym modelem relacji dla operacji centrum danych AI. Łączy infrastrukturę fizyczną, zasoby obliczeniowe, działania operacyjne, ludzi i usługi biznesowe, dzięki czemu zespoły rozumieją, czym jest dany zasób, gdzie się znajduje, co obsługuje, kto jest jego właścicielem i co może zostać dotknięte w razie awarii.
Statyczna lista zasobów nie wyjaśnia infrastruktury AI
Tradycyjne rejestry zasobów zapisują urządzenia, numery seryjne i lokalizacje. Operacje infrastruktury AI wymagają szerszego i bardziej dynamicznego spojrzenia.
Pojedyncze GPU może być częścią serwera fizycznego, przypisane do puli zasobów, przydzielone kontenerowi, wykorzystywane przez obciążenie związane z trenowaniem lub wnioskowaniem, powiązane z projektem i połączone z usługą używaną przez zespół biznesowy.
Gdy te relacje są utrzymywane w osobnych narzędziach, operatorom trudno jest odpowiedzieć na podstawowe pytania podczas incydentu:
Sensaka buduje kontekst relacji potrzebny do odpowiedzi na te pytania.
Pięć wymiarów operacji centrum danych AI w jednym modelu
CMDB Sensaka porządkuje infrastrukturę AI wokół pięciu powiązanych wymiarów.
Ludzie
Rejestrowanie odpowiedzialnych właścicieli, zespołów operacyjnych, dzierżawców, dostawców, ról i uprawnień. Powiązanie infrastruktury i usług z osobami za nie odpowiedzialnymi.
Infrastruktura fizyczna
Zarządzanie obiektami, pomieszczeniami, szafami rack, jednostkami rack, serwerami, kartami akceleratorów, sieciami, systemami pamięci masowej, sprzętem zasilającym i infrastrukturą chłodzenia cieczą.
Działania operacyjne
Powiązanie działań związanych z szeregowaniem zadań, obciążeń związanych z trenowaniem i wnioskowaniem, alarmów, zgłoszeń serwisowych, zmian, inspekcji i rejestrów konserwacji.
Zasoby obliczeniowe
Modelowanie klastrów, węzłów, pul zasobów, specyfikacji, limitów, przydzielonej pojemności i dostępnej pojemności.
Usługi biznesowe
Powiązanie usług modeli, instancji wnioskowania, aplikacji, agentów, projektów i działów biznesowych z infrastrukturą, którą wykorzystują.
Razem te pięć wymiarów tworzy model operacyjny bardziej użyteczny niż sama inwentaryzacja urządzeń.
Automatyczne utrzymywanie aktualnych danych o infrastrukturze
Infrastruktura AI zmienia się nieustannie. Instalowany jest nowy sprzęt, wymieniane są karty akceleratorów, obciążenia są przenoszone, kontenery są restartowane, a przydziały zasobów ulegają zmianie.
Sensaka wykorzystuje wykrywanie infrastruktury i synchronizację konfiguracji, aby ograniczyć zależność od ręcznych aktualizacji. Obsługiwane interfejsy urządzeń, BMC, Kubernetes i infrastruktury mogą dostarczać aktualne dane o konfiguracji i relacjach. Platforma może rejestrować:
Reguły nadrzędności źródeł i sposób rozwiązywania konfliktów należy ustalić na etapie wdrożenia, aby zespoły wiedziały, które źródło jest wiarygodne, gdy automatyczne wykrywanie i ręczne rekordy się różnią.
Wspólne zarządzanie relacjami fizycznymi i logicznymi
Infrastruktura AI obejmuje zarówno fizyczne, jak i logiczne łańcuchy zależności.
Relacje fizyczne
Obiekt, szafa rack, serwer, slot, akcelerator, port sieciowy, połączenie pamięci masowej, ścieżka zasilania i lokalizacja chłodzenia.
Relacje logiczne
Klaster, pula zasobów, kontener, obciążenie, usługa modelu, aplikacja, projekt i właściciel.
Sensaka gromadzi te relacje we wspólnym grafie, dzięki czemu operatorzy mogą przechodzić między widokiem fizycznym a logicznym tej samej usługi. Przykładowo, operator może zacząć od spowolnionej usługi wnioskowania, zlokalizować jej instancję i kontener, zidentyfikować GPU i węzeł, przeanalizować zależności sieciowe i związane z pamięcią masową, a następnie sprawdzić fizyczny serwer i kondycję sprzętu.
Zrozumienie wpływu biznesowego przed podjęciem działania
Gdy akcelerator, węzeł lub komponent infrastruktury zgłasza problem, Sensaka może wykorzystać graf relacji, aby pomóc określić prawdopodobny zasięg wpływu.
Spojrzenie w górę: usługi i kontekst biznesowy
Identyfikacja dotkniętych usług modeli, instancji wnioskowania, aplikacji, projektów i działów biznesowych. Tam, gdzie zarejestrowano zobowiązania dotyczące usług, widok wpływu może uwzględniać odpowiedni kontekst poziomu usług.
Spojrzenie w dół: dowody z infrastruktury
Przegląd statusu akceleratorów, węzłów i komponentów, a następnie korelacja danych o sieci, pamięci masowej, temperaturze i kondycji sprzętu związanych ze zdarzeniem.
Spojrzenie w bok: odpowiedzialność i przepływ pracy
Identyfikacja odpowiedzialnego właściciela lub zespołu operacyjnego oraz utworzenie zgłoszenia z dołączonymi dotkniętymi obiektami i kontekstem analizy.
Dzięki temu przejście od alarmu infrastrukturalnego do odpowiedzi operacyjnej uwzględniającej kontekst biznesowy staje się bardziej przejrzyste.
Śledzenie zmian i odtwarzanie przeszłych stanów
Zmiany konfiguracji mogą wyjaśniać problemy z wydajnością i awarie, ale tylko wtedy, gdy dostępna jest ich historia. Sensaka rejestruje zmiany wraz z poprzednią i nową wartością, operatorem lub źródłem wykrycia oraz czasem obowiązywania. Migawki historyczne pomagają zespołom odtworzyć stan zasobu i jego relacji sprzed danego momentu.
Gdzie sprawdza się CMDB infrastruktury AI
Analiza wpływu awarii GPU
Punktem wyjścia jest alarm akceleratora. Identyfikacja węzła, kontenera, obciążenia, usługi modelu, projektu i właściciela powiązanych z dotkniętą kartą. Przegląd powiązanych danych o temperaturze, zasilaniu, ECC, sieci i pamięci masowej przed przypisaniem odpowiedzi.
Analiza spowolnionej usługi wnioskowania
Punktem wyjścia jest dotknięta usługa, a analiza przebiega w dół — przez instancję, kontener, GPU i węzeł fizyczny. Ustalenie, czy degradacja usługi jest powiązana z warunkami dotyczącymi zasobów, sprzętu lub infrastruktury.
Uzgadnianie zasobów infrastruktury AI
Porównanie wykrytej konfiguracji serwerów i akceleratorów z rekordem CMDB. Identyfikacja brakujących zasobów, zmian konfiguracji lub niespójności lokalizacji.
Przegląd zmian i audytu
Sprawdzenie, kto zmienił zasób lub relację, kiedy nastąpiła zmiana i w jaki sposób została wykryta. Odtworzenie stanu konfiguracji z chwili wystąpienia incydentu.
Mapowanie odpowiedzialności
Powiązanie klastrów, pul zasobów, projektów i usług z właścicielami oraz zespołami operacyjnymi, dzięki czemu incydenty można kierować bez przeszukiwania osobnych list kontaktowych.
Przekazanie z wdrożenia do operacji
Po uruchomieniu serwera następuje jego rejestracja w CMDB, dodanie do monitoringu oraz powiązanie z właściwym obiektem, klastrem i relacjami zasobów.
Wszystko, czego potrzebuje model relacji
Dogłębna widoczność infrastruktury fizycznej — wbudowana
Sensaka łączy funkcje CMDB z dogłębną widocznością infrastruktury fizycznej. Platforma może wykorzystywać interfejsy zarządzania urządzeniami, dane BMC, telemetrię akceleratorów, informacje z Kubernetes, dane sieciowe i rejestry operacyjne, aby model pozostawał połączony z działającym środowiskiem.
Ma to szczególne znaczenie w centrach danych AI, ponieważ łańcuch zależności obejmuje obiekty, sprzęt, platformy programowe i usługi biznesowe. Model relacji zbudowany wyłącznie na danych z chmury lub aplikacji może pomijać kontekst komponentów fizycznych, zasilania, chłodzenia i lokalizacji potrzebny do pełnej analizy wpływu.
Użyteczne CMDB zależy od ładu organizacyjnego w takim samym stopniu, co od technologii
Na etapie wdrożenia Sensaka i klient powinni wspólnie określić:
Najczęściej zadawane pytania
Czym CMDB infrastruktury AI różni się od tradycyjnego CMDB?
Obejmuje karty akceleratorów, klastry, pule zasobów, kontenery, obciążenia AI, usługi modeli oraz ich relacje z fizyczną infrastrukturą centrum danych. Musi odzwierciedlać zarówno szybko zmieniające się przydziały logiczne, jak i długotrwałe zasoby fizyczne.
Czy Sensaka może automatycznie wykrywać GPU?
Sensaka może zbierać dane inwentaryzacyjne akceleratorów oraz relacje węzłów z obsługiwanych interfejsów sprzętowych i programowych. Dokładny zakres pól i częstotliwość aktualizacji zależą od dostępnych producentów i interfejsów zarządzania.
Czy CMDB zastępuje istniejące firmowe CMDB?
Może działać jako podstawa danych dla infrastruktury AI lub integrować się z istniejącym firmowym CMDB. Właściwa architektura zależy od własności danych, granic systemów i obecnych procesów klienta.
Czy platforma może wskazać, która usługa biznesowa jest dotknięta awarią GPU?
Tak, gdy wymagane relacje od GPU przez węzeł, obciążenie, usługę modelu i projekt aż po usługę biznesową są kompletne. Jakość analizy wpływu zależy od kompletności i dokładności tych relacji.
Czy można przeglądać historyczne konfiguracje?
Sensaka obsługuje historię zmian oraz odtwarzanie stanów z określonego momentu dla zarządzanych danych konfiguracyjnych. Okres przechowywania i poziom szczegółowości należy ustalić na etapie wdrożenia.
Czy analiza wpływu może utworzyć zgłoszenie ITSM?
Sensaka może przypisać odpowiedzialny zespół i zainicjować zgłoszenie serwisowe za pośrednictwem dostępnego procesu lub integracji ITSM. Dokładny sposób przekierowywania i zatwierdzania jest konfigurowany dla środowiska klienta.
Dane o infrastrukturze zamienione w kontekst operacyjny
Pełna wiedza o tym, co obsługuje każdy zasób, kto jest jego właścicielem i co zostanie dotknięte, zanim podjęte zostanie kolejne działanie.
Powiązane: Obserwowalność infrastruktury AI, Pomiar zużycia GPU, Monitoring chłodzenia cieczą
