Platforma zarządzania operacjami centrum danych AI

    Ujednolicona platforma zarządzania centrum danych AI stworzona dla operatorów infrastruktury

    Sensaka – platforma zarządzania centrum danych AI łączy infrastrukturę AI, heterogeniczne zasoby obliczeniowe, klastry GPU, obciążenia związane z trenowaniem i wnioskowaniem, sieci, pamięć masową, systemy chłodzenia cieczą i procesy operacyjne w jednej platformie. Przekształca rozproszone zasoby obliczeniowe w możliwości biznesowe, które można monitorować, szeregować, mierzyć i nieustannie optymalizować.

    Od systemów chłodzenia cieczą, serwerów i kart akceleratorów w centrum danych, przez pule zasobów, szeregowanie obciążeń, alarmy, zgłoszenia serwisowe, CMDB, pomiar kosztów, aż po analitykę operacyjną — platforma buduje ujednoliconą pętlę operacyjną opartą na wspólnej podstawie danych.

    Centra danych AI weszły w etap operacyjny

    Od dostarczenia infrastruktury do ciągłych operacji

    Po zbudowaniu centrum danych AI priorytety zarządzania przesuwają się od dostarczenia infrastruktury i liczby sprzętu w stronę wykorzystania zasobów obliczeniowych, wskaźników powodzenia obciążeń, jakości usług, kosztów operacyjnych i efektów biznesowych.

    Tradycyjne platformy monitoringu zwykle potrafią wskazać, czy urządzenie jest online. Nie potrafią jednak łatwo wyjaśnić, czy zasoby obliczeniowe są wykorzystywane efektywnie, dlaczego zadania treningowe oczekują, czy niskie wykorzystanie GPU wynika z wąskich gardeł w zasobach obliczeniowych, sieci czy pamięci masowej, ani które obciążenia i usługi biznesowe zostaną dotknięte awarią sprzętu.

    Sensaka – platforma zarządzania operacjami centrum danych AI łączy pięć wymiarów operacyjnych: ludzi, infrastrukturę fizyczną, działania, zasoby obliczeniowe i usługi biznesowe.

    Łączy status infrastruktury, zasoby obliczeniowe, relacje obciążeń, dostarczanie usług, odpowiedzialność pracowników i procesy operacyjne w jednym, ujednoliconym środowisku zarządzania, pomagając organizacjom przejść od modelu dostarczania infrastruktury do ciągłych operacji centrum danych AI.

    Platforma

    Jedna platforma dla ujednoliconego zarządzania centrum danych AI

    Ujednolicony monitoring

    Centralizacja statusu, wydajności, pojemności i alarmów serwerów, kart akceleratorów, sieci, systemów pamięci masowej, szaf rack, systemów zasilania, sprzętu do chłodzenia cieczą i infrastruktury środowiskowej.

    Ujednolicone zarządzanie

    Wykorzystanie CMDB infrastruktury AI do budowania relacji w czasie rzeczywistym między centrami danych, urządzeniami, kartami akceleratorów, klastrami, obciążeniami, projektami, zespołami i usługami biznesowymi.

    Ujednolicone szeregowanie

    Przekształcanie rozproszonych fizycznych zasobów obliczeniowych w ustandaryzowane pule zasobów, które można rezerwować, przydzielać, zwalniać i nadzorować.

    Ujednolicony pomiar zużycia

    Pomiar godzin pracy akceleratorów, zużycia zasobów, zużycia energii i danych operacyjnych w podziale na projekt, dzierżawcę i typ zasobu.

    Ujednolicone operacje

    Połączenie monitoringu, analizy, diagnostyki, alarmów, zgłoszeń serwisowych, zatwierdzeń i działań związanych z szeregowaniem zadań w jeden kompletny proces operacyjny.

    Zarządzanie heterogenicznymi zasobami obliczeniowymi

    Zarządzanie zasobami GPU i NPU wielu producentów w jednej platformie

    Centra danych AI często zawierają sprzęt akceleracyjny różnych producentów, modeli i architektur. Sensaka zapewnia ujednolicone zarządzanie heterogenicznymi zasobami obliczeniowymi w takich środowiskach.

    Platforma identyfikuje typy akceleratorów w każdym węźle, gromadzi GPU i NPU różnych producentów we wspólnej inwentaryzacji oraz buduje relacje między modelem akceleratora, jego liczbą, węzłem fizycznym, statusem operacyjnym i przydziałem zasobów.

    Podstawowe funkcje

    • Automatyczna identyfikacja GPU i NPU wielu producentów
    • Inwentaryzacja kart akceleratorów na poziomie komponentów
    • Ujednolicone zarządzanie w wielu regionach i klastrach
    • Monitoring wykorzystania, temperatury, zasilania i kondycji na poziomie karty
    • Wykrywanie nieprawidłowości akceleratorów i rekomendacje izolacji
    • Ujednolicona widoczność pełnych kart i zasobów podzielonych na partycje

    Wartość biznesowa

    Ograniczenie zależności od osobnych narzędzi producentów i zarządzanie heterogenicznymi zasobami obliczeniowymi za pomocą jednego spójnego interfejsu.

    Tworzy to wiarygodną podstawę danych do szeregowania zadań, planowania pojemności, zarządzania infrastrukturą i podejmowania decyzji operacyjnych.

    Szeregowanie zasobów GPU

    Przekształcanie sprzętu GPU w zasoby obliczeniowe gotowe do przydziału

    Sensaka przekształca fizyczne karty akceleratorów w pule zasobów i zarządza obciążeniami związanymi z trenowaniem, wnioskowaniem i pracami programistycznymi za pomocą ustandaryzowanych specyfikacji, limitów dla dzierżawców, kolejek obciążeń i polityk szeregowania.

    Platforma obsługuje dedykowany przydział GPU, współdzielone partycje GPU, ważenie zasobów, strategie zapełniania węzłów, kontrolę limitów oraz automatyczne zwalnianie zasobów po zakończeniu obciążenia. Funkcje te pomagają centrom danych AI ograniczyć fragmentację, przestoje zasobów i nieefektywny przydział.

    Podstawowe funkcje

    • Łączenie heterogenicznych zasobów obliczeniowych w pule
    • Specyfikacje zasobów dla trenowania, wnioskowania i prac programistycznych
    • Klasyfikacja obciążeń związanych z trenowaniem i wnioskowaniem
    • Zarządzanie kolejkami obciążeń
    • Kontrola limitów dla projektów i dzierżawców
    • Przydział dedykowanych GPU i współdzielonych partycji
    • Strategie priorytetów, wagi zasobów i zapełniania węzłów
    • Automatyczne zwalnianie zasobów po zakończeniu lub przekroczeniu limitu czasu
    • Izolacja uszkodzonych węzłów i ponowne szeregowanie obciążeń
    • Analiza fragmentacji pamięci GPU i rekomendacje konsolidacji

    Wartość biznesowa

    Zwiększenie wykorzystania GPU, ograniczenie nadmiernego przydziału i przestojów oraz priorytetyzacja zasobów obliczeniowych dla obciążeń o najwyższej wartości biznesowej.

    Korelacja GPU i kontenerów

    Śledzenie każdego obciążenia aż do karty akceleratora

    Platforma buduje dynamiczne relacje między obciążeniami, kontenerami, GPU, węzłami i pulami zasobów. Operatorzy mogą sprawdzić, które kontenery korzystają z danego GPU, oraz zobaczyć, które karty akceleratorów zostały przypisane do konkretnego kontenera.

    Sensaka monitoruje również żądaną pamięć GPU, limity zasobów i rzeczywiste szczytowe zużycie, rejestrując przy tym zdarzenia przypisania i zwolnienia GPU na potrzeby analizy zasobów, analizy incydentów i audytu.

    Podstawowe funkcje

    • Dwukierunkowe wyszukiwanie GPU i kontenerów
    • Mapowanie relacji między identyfikatorem UUID GPU a kontenerem
    • Chronologia przypisań i zwolnień GPU
    • Analiza żądanej, limitowanej i szczytowej pamięci kontenera
    • Identyfikacja obciążeń o wysokim przydziale i niskim wykorzystaniu
    • Analiza rywalizacji o współdzielone zasoby GPU
    • Korelacja między awariami kontenerów a nadmiernym przydziałem zasobów
    Koordynacja zasobów obliczeniowych, sieci i pamięci masowej

    Analiza GPU, sieci treningowych i pamięci masowej na jednej osi czasu

    Niskie wykorzystanie GPU nie zawsze oznacza niewystarczające zapotrzebowanie na moc obliczeniową. Utrata pakietów w sieci, niewystarczająca przepustowość pamięci masowej, wolne wczytywanie danych lub problemy sprzętowe mogą zmuszać GPU do oczekiwania, pozostawiając kosztowne zasoby obliczeniowe bezczynne.

    Sensaka zestawia wykorzystanie GPU, opóźnienia sieciowe, utratę pakietów i retransmisje RoCE lub RDMA, przepustowość pamięci masowej, IOPS, opóźnienia odczytu i zapisu oraz kondycję węzłów na wspólnej osi czasu operacji.

    Podstawowe funkcje

    • Zsynchronizowana w czasie analiza metryk GPU, sieci i pamięci masowej
    • Analiza wąskich gardeł sieci RoCE i RDMA
    • Łączna analiza utraty pakietów, retransmisji, opóźnień i kondycji portów
    • Analiza przepustowości, IOPS i opóźnień pamięci masowej
    • Identyfikacja wąskich gardeł wczytywania danych i zapisu punktów kontrolnych
    • Łączna analiza temperatury, zasilania, ECC i kondycji sprzętu
    • Czteroetapowa pętla operacyjna obejmująca monitoring, analizę, diagnostykę i szeregowanie zadań
    • Generowanie rekomendacji, autoryzowane wykonywanie działań i audyt operacyjny

    Wartość biznesowa

    Szybkie ustalenie, czy problem z wydajnością wynika z zasobów obliczeniowych, sieci, pamięci masowej czy infrastruktury sprzętowej.

    Skrócenie czasu analizy między zespołami i ograniczenie ryzyka, że długo trwające zadania treningowe zostaną przerwane, zrestartowane lub będą bezproduktywnie zużywać zasoby.

    Poznaj obserwowalność infrastruktury AI
    Monitoring chłodzenia cieczą

    Ujednolicony monitoring chłodzenia cieczą i infrastruktury obiektowej dla gęstej infrastruktury AI

    W miarę jak rośnie zużycie energii przez serwery GPU i gęstość obciążenia szaf rack, chłodzenie cieczą staje się kluczowym elementem niezawodnego działania centrów danych AI.

    Sensaka monitoruje status systemu chłodzenia cieczą, temperaturę na wlocie i wylocie, różnice ciśnień oraz powiązane wskaźniki środowiskowe. Metryki te są korelowane z gęstością mocy szaf rack, temperaturą, wilgotnością, wykrywaniem wycieków i danymi dystrybucji zasilania, aby pomóc operatorom identyfikować awarie chłodzenia i zagrożenia termiczne.

    Podstawowe funkcje

    • Monitoring statusu CDU i systemu chłodzenia cieczą
    • Monitoring temperatury na wlocie i wylocie
    • Monitoring różnicy ciśnień
    • Monitoring temperatury i wilgotności
    • Monitoring zdarzeń wycieku cieczy
    • Analiza gęstości mocy na poziomie szafy rack
    • Identyfikacja przeciążonych szaf rack i gorących punktów termicznych
    • Monitoring dystrybucji zasilania i obwodów PDU
    • Łączna analiza przestrzeni w szafie rack, zasilania i wydajności chłodzenia

    Wartość biznesowa

    Włączenie monitoringu chłodzenia cieczą w szersze środowisko operacyjne infrastruktury AI.

    Identyfikacja zagrożeń związanych z temperaturą, ciśnieniem, wyciekami i pojemnością, zanim wpłyną na gęste klastry GPU.

    Poznaj monitoring chłodzenia cieczą
    CMDB infrastruktury AI

    Przekształcenie inwentaryzacji zasobów w podstawę danych o relacjach w czasie rzeczywistym

    CMDB Sensaka to znacznie więcej niż statyczna lista urządzeń. Nieustannie rejestruje relacje między ludźmi, infrastrukturą fizyczną, działaniami operacyjnymi, zasobami obliczeniowymi i usługami biznesowymi.

    Ta wspólna podstawa danych wspiera monitoring, szeregowanie zadań, pomiar zużycia, zarządzanie alarmami, zgłoszenia serwisowe i analizę wpływu biznesowego.

    Podstawowe funkcje

    • Automatyczne wykrywanie urządzeń i komponentów
    • Zarządzanie relacjami centrum danych, szafy rack i jednostki rack
    • Ujednolicona inwentaryzacja serwerów, GPU, sieci, pamięci masowej i systemów chłodzenia cieczą
    • Śledzenie relacji obciążeń, kontenerów, węzłów i akceleratorów
    • Powiązania dzierżawców, projektów, zespołów i właścicieli
    • Śledzenie zmian konfiguracji i migawki historyczne
    • Automatyczna analiza wpływu dzięki mapowaniu relacji
    • Jedno wspólne źródło konfiguracji dla monitoringu, szeregowania zadań, pomiaru zużycia i zarządzania usługami
    Pętla operacyjna

    Od monitoringu infrastruktury do operacji w zamkniętej pętli

    Sensaka – platforma zarządzania operacjami centrum danych AI łączy wykrywanie zasobów, wdrażanie urządzeń, łączenie zasobów w pule, żądania obciążeń, inteligentne szeregowanie, pomiar zużycia, analitykę i optymalizację operacyjną. Wnioski z analizy operacyjnej można wykorzystać do dostosowania specyfikacji zasobów, polityk szeregowania, limitów i zakresu zarządzania, tworząc ciągłą pętlę optymalizacji.

    01

    Gotowość zasobów

    Automatyczne wykrywanie urządzeń, zarządzanie heterogenicznymi zasobami obliczeniowymi oraz tworzenie ustandaryzowanych pul zasobów i specyfikacji.

    02

    Dostarczanie obciążeń

    Przydzielanie zasobów obliczeniowych obciążeniom związanym z trenowaniem, wnioskowaniem i pracami programistycznymi za pomocą kolejek, limitów projektowych i polityk szeregowania.

    03

    Optymalizacja operacyjna

    Ciągła optymalizacja przydziału zasobów i polityk operacyjnych na podstawie danych o wykorzystaniu, statusie obciążeń, wydajności zasobów obliczeniowych, sieci i pamięci masowej, kondycji sprzętu oraz kosztach.

    Przypadki użycia

    Stworzone dla każdego środowiska infrastruktury AI

    Centra danych AI klasy enterprise

    Zarządzanie serwerami GPU, siecią, pamięcią masową, infrastrukturą chłodzenia cieczą i szeregowaniem obciążeń w jednej platformie w celu zwiększenia wewnętrznego wykorzystania zasobów.

    Publiczne centra obliczeniowe

    Tworzenie wielodzierżawczych pul zasobów, limitów projektowych, kolejek obciążeń i raportowania zużycia w celu usprawnienia dostarczania zasobów i działalności komercyjnej.

    Usługi finansowe i branże o wysokich wymaganiach dostępności

    Wykorzystanie zbierania danych in-band i out-of-band, monitoringu na poziomie komponentów, analizy wpływu awarii i podlegających audytowi procesów operacyjnych w celu ochrony krytycznych usług trenowania i wnioskowania.

    Telekomunikacja i środowiska wielolokalizacyjne

    Scentralizowane zarządzanie regionalnymi centrami danych, rozproszonymi klastrami, zasobami infrastruktury i danymi operacyjnymi w wielu lokalizacjach.

    Uczelnie i organizacje badawcze

    Zarządzanie wnioskami o GPU, limitami, przydziałem, wykorzystaniem i zwalnianiem zasobów w zespołach badawczych, działach i projektach.

    Wartość platformy

    Co się zmienia, gdy każdy akcelerator jest zarządzany

    Pełna widoczność zasobów obliczeniowych

    Widoczność GPU, NPU, serwerów, sieci, pamięci masowej, sprzętu do chłodzenia cieczą i zasobów szaf rack w jednej platformie.

    Lepsze wykorzystanie zasobów

    Ograniczenie marnotrawstwa zasobów obliczeniowych dzięki łączeniu zasobów w pule, zarządzaniu specyfikacjami, szeregowaniu obciążeń i identyfikacji bezczynnych zasobów.

    Szybsze rozwiązywanie problemów

    Wykorzystanie korelacji GPU i kontenerów wraz z analizą zasobów obliczeniowych, sieci i pamięci masowej w celu szybszej identyfikacji wąskich gardeł i wpływu biznesowego.

    Ochrona stabilności trenowania i wnioskowania

    Wykrywanie zagrożeń związanych ze sprzętem, siecią, pamięcią masową, temperaturą i chłodzeniem cieczą, zanim przerwą działanie obciążeń.

    Budowa wiarygodnej podstawy danych operacyjnych

    Powiązanie zasobów, obciążeń, projektów, pracowników, kosztów i usług biznesowych na potrzeby decyzji operacyjnych i zarządczych.

    Rozpocznij

    Każdy akcelerator widoczny, zarządzalny, planowalny i mierzalny

    Sensaka – platforma zarządzania operacjami centrum danych AI pomaga organizacjom zarządzać infrastrukturą AI i heterogenicznymi zasobami obliczeniowymi w jednym, ujednoliconym środowisku. Tworzy kompletną pętlę operacyjną — od monitoringu urządzeń i szeregowania zasobów GPU, przez koordynację zasobów obliczeniowych, sieci i pamięci masowej, monitoring chłodzenia cieczą i CMDB, aż po pomiar zużycia i optymalizację operacyjną.