Ujednolicona platforma zarządzania centrum danych AI stworzona dla operatorów infrastruktury
Sensaka – platforma zarządzania centrum danych AI łączy infrastrukturę AI, heterogeniczne zasoby obliczeniowe, klastry GPU, obciążenia związane z trenowaniem i wnioskowaniem, sieci, pamięć masową, systemy chłodzenia cieczą i procesy operacyjne w jednej platformie. Przekształca rozproszone zasoby obliczeniowe w możliwości biznesowe, które można monitorować, szeregować, mierzyć i nieustannie optymalizować.
Od systemów chłodzenia cieczą, serwerów i kart akceleratorów w centrum danych, przez pule zasobów, szeregowanie obciążeń, alarmy, zgłoszenia serwisowe, CMDB, pomiar kosztów, aż po analitykę operacyjną — platforma buduje ujednoliconą pętlę operacyjną opartą na wspólnej podstawie danych.
Od dostarczenia infrastruktury do ciągłych operacji
Po zbudowaniu centrum danych AI priorytety zarządzania przesuwają się od dostarczenia infrastruktury i liczby sprzętu w stronę wykorzystania zasobów obliczeniowych, wskaźników powodzenia obciążeń, jakości usług, kosztów operacyjnych i efektów biznesowych.
Tradycyjne platformy monitoringu zwykle potrafią wskazać, czy urządzenie jest online. Nie potrafią jednak łatwo wyjaśnić, czy zasoby obliczeniowe są wykorzystywane efektywnie, dlaczego zadania treningowe oczekują, czy niskie wykorzystanie GPU wynika z wąskich gardeł w zasobach obliczeniowych, sieci czy pamięci masowej, ani które obciążenia i usługi biznesowe zostaną dotknięte awarią sprzętu.
Sensaka – platforma zarządzania operacjami centrum danych AI łączy pięć wymiarów operacyjnych: ludzi, infrastrukturę fizyczną, działania, zasoby obliczeniowe i usługi biznesowe.
Łączy status infrastruktury, zasoby obliczeniowe, relacje obciążeń, dostarczanie usług, odpowiedzialność pracowników i procesy operacyjne w jednym, ujednoliconym środowisku zarządzania, pomagając organizacjom przejść od modelu dostarczania infrastruktury do ciągłych operacji centrum danych AI.
Jedna platforma dla ujednoliconego zarządzania centrum danych AI
Ujednolicony monitoring
Centralizacja statusu, wydajności, pojemności i alarmów serwerów, kart akceleratorów, sieci, systemów pamięci masowej, szaf rack, systemów zasilania, sprzętu do chłodzenia cieczą i infrastruktury środowiskowej.
Ujednolicone zarządzanie
Wykorzystanie CMDB infrastruktury AI do budowania relacji w czasie rzeczywistym między centrami danych, urządzeniami, kartami akceleratorów, klastrami, obciążeniami, projektami, zespołami i usługami biznesowymi.
Ujednolicone szeregowanie
Przekształcanie rozproszonych fizycznych zasobów obliczeniowych w ustandaryzowane pule zasobów, które można rezerwować, przydzielać, zwalniać i nadzorować.
Ujednolicony pomiar zużycia
Pomiar godzin pracy akceleratorów, zużycia zasobów, zużycia energii i danych operacyjnych w podziale na projekt, dzierżawcę i typ zasobu.
Ujednolicone operacje
Połączenie monitoringu, analizy, diagnostyki, alarmów, zgłoszeń serwisowych, zatwierdzeń i działań związanych z szeregowaniem zadań w jeden kompletny proces operacyjny.
Zarządzanie zasobami GPU i NPU wielu producentów w jednej platformie
Centra danych AI często zawierają sprzęt akceleracyjny różnych producentów, modeli i architektur. Sensaka zapewnia ujednolicone zarządzanie heterogenicznymi zasobami obliczeniowymi w takich środowiskach.
Platforma identyfikuje typy akceleratorów w każdym węźle, gromadzi GPU i NPU różnych producentów we wspólnej inwentaryzacji oraz buduje relacje między modelem akceleratora, jego liczbą, węzłem fizycznym, statusem operacyjnym i przydziałem zasobów.
Podstawowe funkcje
- Automatyczna identyfikacja GPU i NPU wielu producentów
- Inwentaryzacja kart akceleratorów na poziomie komponentów
- Ujednolicone zarządzanie w wielu regionach i klastrach
- Monitoring wykorzystania, temperatury, zasilania i kondycji na poziomie karty
- Wykrywanie nieprawidłowości akceleratorów i rekomendacje izolacji
- Ujednolicona widoczność pełnych kart i zasobów podzielonych na partycje
Wartość biznesowa
Ograniczenie zależności od osobnych narzędzi producentów i zarządzanie heterogenicznymi zasobami obliczeniowymi za pomocą jednego spójnego interfejsu.
Tworzy to wiarygodną podstawę danych do szeregowania zadań, planowania pojemności, zarządzania infrastrukturą i podejmowania decyzji operacyjnych.
Przekształcanie sprzętu GPU w zasoby obliczeniowe gotowe do przydziału
Sensaka przekształca fizyczne karty akceleratorów w pule zasobów i zarządza obciążeniami związanymi z trenowaniem, wnioskowaniem i pracami programistycznymi za pomocą ustandaryzowanych specyfikacji, limitów dla dzierżawców, kolejek obciążeń i polityk szeregowania.
Platforma obsługuje dedykowany przydział GPU, współdzielone partycje GPU, ważenie zasobów, strategie zapełniania węzłów, kontrolę limitów oraz automatyczne zwalnianie zasobów po zakończeniu obciążenia. Funkcje te pomagają centrom danych AI ograniczyć fragmentację, przestoje zasobów i nieefektywny przydział.
Podstawowe funkcje
- Łączenie heterogenicznych zasobów obliczeniowych w pule
- Specyfikacje zasobów dla trenowania, wnioskowania i prac programistycznych
- Klasyfikacja obciążeń związanych z trenowaniem i wnioskowaniem
- Zarządzanie kolejkami obciążeń
- Kontrola limitów dla projektów i dzierżawców
- Przydział dedykowanych GPU i współdzielonych partycji
- Strategie priorytetów, wagi zasobów i zapełniania węzłów
- Automatyczne zwalnianie zasobów po zakończeniu lub przekroczeniu limitu czasu
- Izolacja uszkodzonych węzłów i ponowne szeregowanie obciążeń
- Analiza fragmentacji pamięci GPU i rekomendacje konsolidacji
Wartość biznesowa
Zwiększenie wykorzystania GPU, ograniczenie nadmiernego przydziału i przestojów oraz priorytetyzacja zasobów obliczeniowych dla obciążeń o najwyższej wartości biznesowej.
Śledzenie każdego obciążenia aż do karty akceleratora
Platforma buduje dynamiczne relacje między obciążeniami, kontenerami, GPU, węzłami i pulami zasobów. Operatorzy mogą sprawdzić, które kontenery korzystają z danego GPU, oraz zobaczyć, które karty akceleratorów zostały przypisane do konkretnego kontenera.
Sensaka monitoruje również żądaną pamięć GPU, limity zasobów i rzeczywiste szczytowe zużycie, rejestrując przy tym zdarzenia przypisania i zwolnienia GPU na potrzeby analizy zasobów, analizy incydentów i audytu.
Podstawowe funkcje
- Dwukierunkowe wyszukiwanie GPU i kontenerów
- Mapowanie relacji między identyfikatorem UUID GPU a kontenerem
- Chronologia przypisań i zwolnień GPU
- Analiza żądanej, limitowanej i szczytowej pamięci kontenera
- Identyfikacja obciążeń o wysokim przydziale i niskim wykorzystaniu
- Analiza rywalizacji o współdzielone zasoby GPU
- Korelacja między awariami kontenerów a nadmiernym przydziałem zasobów
Analiza GPU, sieci treningowych i pamięci masowej na jednej osi czasu
Niskie wykorzystanie GPU nie zawsze oznacza niewystarczające zapotrzebowanie na moc obliczeniową. Utrata pakietów w sieci, niewystarczająca przepustowość pamięci masowej, wolne wczytywanie danych lub problemy sprzętowe mogą zmuszać GPU do oczekiwania, pozostawiając kosztowne zasoby obliczeniowe bezczynne.
Sensaka zestawia wykorzystanie GPU, opóźnienia sieciowe, utratę pakietów i retransmisje RoCE lub RDMA, przepustowość pamięci masowej, IOPS, opóźnienia odczytu i zapisu oraz kondycję węzłów na wspólnej osi czasu operacji.
Podstawowe funkcje
- Zsynchronizowana w czasie analiza metryk GPU, sieci i pamięci masowej
- Analiza wąskich gardeł sieci RoCE i RDMA
- Łączna analiza utraty pakietów, retransmisji, opóźnień i kondycji portów
- Analiza przepustowości, IOPS i opóźnień pamięci masowej
- Identyfikacja wąskich gardeł wczytywania danych i zapisu punktów kontrolnych
- Łączna analiza temperatury, zasilania, ECC i kondycji sprzętu
- Czteroetapowa pętla operacyjna obejmująca monitoring, analizę, diagnostykę i szeregowanie zadań
- Generowanie rekomendacji, autoryzowane wykonywanie działań i audyt operacyjny
Wartość biznesowa
Szybkie ustalenie, czy problem z wydajnością wynika z zasobów obliczeniowych, sieci, pamięci masowej czy infrastruktury sprzętowej.
Skrócenie czasu analizy między zespołami i ograniczenie ryzyka, że długo trwające zadania treningowe zostaną przerwane, zrestartowane lub będą bezproduktywnie zużywać zasoby.
Ujednolicony monitoring chłodzenia cieczą i infrastruktury obiektowej dla gęstej infrastruktury AI
W miarę jak rośnie zużycie energii przez serwery GPU i gęstość obciążenia szaf rack, chłodzenie cieczą staje się kluczowym elementem niezawodnego działania centrów danych AI.
Sensaka monitoruje status systemu chłodzenia cieczą, temperaturę na wlocie i wylocie, różnice ciśnień oraz powiązane wskaźniki środowiskowe. Metryki te są korelowane z gęstością mocy szaf rack, temperaturą, wilgotnością, wykrywaniem wycieków i danymi dystrybucji zasilania, aby pomóc operatorom identyfikować awarie chłodzenia i zagrożenia termiczne.
Podstawowe funkcje
- Monitoring statusu CDU i systemu chłodzenia cieczą
- Monitoring temperatury na wlocie i wylocie
- Monitoring różnicy ciśnień
- Monitoring temperatury i wilgotności
- Monitoring zdarzeń wycieku cieczy
- Analiza gęstości mocy na poziomie szafy rack
- Identyfikacja przeciążonych szaf rack i gorących punktów termicznych
- Monitoring dystrybucji zasilania i obwodów PDU
- Łączna analiza przestrzeni w szafie rack, zasilania i wydajności chłodzenia
Wartość biznesowa
Włączenie monitoringu chłodzenia cieczą w szersze środowisko operacyjne infrastruktury AI.
Identyfikacja zagrożeń związanych z temperaturą, ciśnieniem, wyciekami i pojemnością, zanim wpłyną na gęste klastry GPU.
Przekształcenie inwentaryzacji zasobów w podstawę danych o relacjach w czasie rzeczywistym
CMDB Sensaka to znacznie więcej niż statyczna lista urządzeń. Nieustannie rejestruje relacje między ludźmi, infrastrukturą fizyczną, działaniami operacyjnymi, zasobami obliczeniowymi i usługami biznesowymi.
Ta wspólna podstawa danych wspiera monitoring, szeregowanie zadań, pomiar zużycia, zarządzanie alarmami, zgłoszenia serwisowe i analizę wpływu biznesowego.
Podstawowe funkcje
- Automatyczne wykrywanie urządzeń i komponentów
- Zarządzanie relacjami centrum danych, szafy rack i jednostki rack
- Ujednolicona inwentaryzacja serwerów, GPU, sieci, pamięci masowej i systemów chłodzenia cieczą
- Śledzenie relacji obciążeń, kontenerów, węzłów i akceleratorów
- Powiązania dzierżawców, projektów, zespołów i właścicieli
- Śledzenie zmian konfiguracji i migawki historyczne
- Automatyczna analiza wpływu dzięki mapowaniu relacji
- Jedno wspólne źródło konfiguracji dla monitoringu, szeregowania zadań, pomiaru zużycia i zarządzania usługami
Od monitoringu infrastruktury do operacji w zamkniętej pętli
Sensaka – platforma zarządzania operacjami centrum danych AI łączy wykrywanie zasobów, wdrażanie urządzeń, łączenie zasobów w pule, żądania obciążeń, inteligentne szeregowanie, pomiar zużycia, analitykę i optymalizację operacyjną. Wnioski z analizy operacyjnej można wykorzystać do dostosowania specyfikacji zasobów, polityk szeregowania, limitów i zakresu zarządzania, tworząc ciągłą pętlę optymalizacji.
Gotowość zasobów
Automatyczne wykrywanie urządzeń, zarządzanie heterogenicznymi zasobami obliczeniowymi oraz tworzenie ustandaryzowanych pul zasobów i specyfikacji.
Dostarczanie obciążeń
Przydzielanie zasobów obliczeniowych obciążeniom związanym z trenowaniem, wnioskowaniem i pracami programistycznymi za pomocą kolejek, limitów projektowych i polityk szeregowania.
Optymalizacja operacyjna
Ciągła optymalizacja przydziału zasobów i polityk operacyjnych na podstawie danych o wykorzystaniu, statusie obciążeń, wydajności zasobów obliczeniowych, sieci i pamięci masowej, kondycji sprzętu oraz kosztach.
Stworzone dla każdego środowiska infrastruktury AI
Centra danych AI klasy enterprise
Zarządzanie serwerami GPU, siecią, pamięcią masową, infrastrukturą chłodzenia cieczą i szeregowaniem obciążeń w jednej platformie w celu zwiększenia wewnętrznego wykorzystania zasobów.
Publiczne centra obliczeniowe
Tworzenie wielodzierżawczych pul zasobów, limitów projektowych, kolejek obciążeń i raportowania zużycia w celu usprawnienia dostarczania zasobów i działalności komercyjnej.
Usługi finansowe i branże o wysokich wymaganiach dostępności
Wykorzystanie zbierania danych in-band i out-of-band, monitoringu na poziomie komponentów, analizy wpływu awarii i podlegających audytowi procesów operacyjnych w celu ochrony krytycznych usług trenowania i wnioskowania.
Telekomunikacja i środowiska wielolokalizacyjne
Scentralizowane zarządzanie regionalnymi centrami danych, rozproszonymi klastrami, zasobami infrastruktury i danymi operacyjnymi w wielu lokalizacjach.
Uczelnie i organizacje badawcze
Zarządzanie wnioskami o GPU, limitami, przydziałem, wykorzystaniem i zwalnianiem zasobów w zespołach badawczych, działach i projektach.
Co się zmienia, gdy każdy akcelerator jest zarządzany
Pełna widoczność zasobów obliczeniowych
Widoczność GPU, NPU, serwerów, sieci, pamięci masowej, sprzętu do chłodzenia cieczą i zasobów szaf rack w jednej platformie.
Lepsze wykorzystanie zasobów
Ograniczenie marnotrawstwa zasobów obliczeniowych dzięki łączeniu zasobów w pule, zarządzaniu specyfikacjami, szeregowaniu obciążeń i identyfikacji bezczynnych zasobów.
Szybsze rozwiązywanie problemów
Wykorzystanie korelacji GPU i kontenerów wraz z analizą zasobów obliczeniowych, sieci i pamięci masowej w celu szybszej identyfikacji wąskich gardeł i wpływu biznesowego.
Ochrona stabilności trenowania i wnioskowania
Wykrywanie zagrożeń związanych ze sprzętem, siecią, pamięcią masową, temperaturą i chłodzeniem cieczą, zanim przerwą działanie obciążeń.
Budowa wiarygodnej podstawy danych operacyjnych
Powiązanie zasobów, obciążeń, projektów, pracowników, kosztów i usług biznesowych na potrzeby decyzji operacyjnych i zarządczych.
Poznaj rozwiązania Sensaka dla infrastruktury AI
Każdy akcelerator widoczny, zarządzalny, planowalny i mierzalny
Sensaka – platforma zarządzania operacjami centrum danych AI pomaga organizacjom zarządzać infrastrukturą AI i heterogenicznymi zasobami obliczeniowymi w jednym, ujednoliconym środowisku. Tworzy kompletną pętlę operacyjną — od monitoringu urządzeń i szeregowania zasobów GPU, przez koordynację zasobów obliczeniowych, sieci i pamięci masowej, monitoring chłodzenia cieczą i CMDB, aż po pomiar zużycia i optymalizację operacyjną.
