Platforma zarządzania operacjami centrum danych AI Sensaka

    Pomiar wykorzystania GPU i alokacja kosztów

    Zrozumienie, kto korzysta z mocy GPU, ile zużywa i gdzie kosztowne zasoby pozostają bezczynne.

    Sensaka mierzy wykorzystanie akceleratorów w projektach, u dzierżawców, w modelach i typach GPU. Przekształca dane harmonogramowania i infrastruktury w możliwe do prześledzenia rekordy godzin karty GPU, widoki wykorzystania oraz dane wejściowe do alokacji kosztów dla platform AI klasy enterprise, współdzielonych centrów obliczeniowych i środowisk badawczych.

    Problem

    Współdzielona infrastruktura GPU wymaga wspólnego rekordu wykorzystania

    Gdy kilka zespołów współdzieli to samo środowisko GPU, sam przydział nie wyjaśnia zużycia. Jeden projekt może rezerwować kilka GPU, ale wykorzystywać je w niewielkim stopniu. Inny zespół może wykorzystywać partycjonowane akceleratory do krótkich obciążeń wnioskowania. Zadania związane z trenowaniem, pracami programistycznymi i wnioskowaniem mogą korzystać z różnych modeli GPU o różnych wewnętrznych stawkach kosztowych. Zużycie energii, pamięci masowej i Tokenów może również wymagać powiązania z tym samym projektem.

    Bez spójnego modelu pomiaru zespoły infrastruktury mają trudności z odpowiedzią na pytania:

    Ile godzin karty GPU zużył każdy projekt?
    Którzy dzierżawcy utrzymują zasoby, nie wykorzystując ich efektywnie?
    Które typy akceleratorów generują najwyższy koszt wewnętrzny?
    W jaki sposób powinny być przydzielane współdzielone lub partycjonowane GPU?
    Jakie dane potwierdzają showback, budżetowanie lub rozliczenia wewnętrzne?

    Sensaka tworzy rekordy wykorzystania potrzebne do odpowiedzi na te pytania.

    Jednostka pomiaru

    Pomiar godzin karty GPU

    Podstawową jednostką pomiaru Sensaka jest godzina karty GPU. Godziny karty GPU oblicza się jako:

    Godziny karty GPU = liczba przydzielonych kart × czas trwania przydziału

    W przypadku partycjonowanych lub wirtualnych zasobów akceleratorów wykorzystanie można przeliczać proporcjonalnie zgodnie z uzgodnioną wagą partycji. Tworzy to spójny punkt odniesienia do porównywania obciążeń wykorzystujących różną liczbę akceleratorów przez różny czas.

    1.Jedno pełne GPU przydzielone na dziesięć godzin odpowiada dziesięciu godzinom karty GPU.
    2.Cztery pełne GPU przydzielone na trzy godziny odpowiadają dwunastu godzinom karty GPU.
    3.Partycja stanowiąca jedną czwartą GPU przydzielona na osiem godzin może zostać zarejestrowana jako dwie równoważne godziny karty GPU, zgodnie z uzgodnioną z klientem zasadą ważenia.

    Polityka pomiaru powinna zostać potwierdzona podczas wdrożenia, zwłaszcza gdy stosowane są różne technologie partycjonowania i różni producenci akceleratorów.

    Wymiary alokacji

    Przypisanie wykorzystania do właściwego wymiaru biznesowego

    Sensaka może organizować zmierzone wykorzystanie w czterech głównych wymiarach alokacji.

    Projekt

    Zrozumienie, ile mocy GPU zużywa każdy projekt AI, oraz porównanie wykorzystania w działaniach związanych z trenowaniem, wnioskowaniem i pracami programistycznymi.

    Dzierżawca lub zespół

    Widoki wykorzystania dla działów, grup badawczych, klientów lub wewnętrznych dzierżawców platformy współdzielących infrastrukturę.

    Model lub usługa

    Powiązanie wykorzystania zasobów z modelem, usługą wnioskowania lub kategorią obciążenia, gdy dostępne są odpowiednie etykiety usługi i obciążenia.

    Typ akceleratora

    Rozdzielenie zużycia według modelu GPU lub NPU, aby organizacje mogły porównywać wykorzystanie i koszt w różnych klasach sprzętu.

    Wymiary te dają zespołom finansowym, platformowym i infrastruktury wspólną strukturę do analizy.

    Bezczynna pojemność

    Identyfikacja bezczynnej i niedostatecznie wykorzystywanej pojemności

    Przydzielona pojemność nie zawsze jest pojemnością produktywną. Sensaka łączy rekordy harmonogramowania z danymi o wykorzystaniu, aby pomóc zespołom zidentyfikować:

    Bezczynne godziny karty GPU
    Wskaźnik bezczynności zasobów
    Obciążenia o wysokim przydziale i niskim wykorzystaniu
    Wzorce wykorzystania według pory dnia
    Projekty z długotrwałą rezerwacją, ale ograniczoną aktywnością
    Różnice między modelami akceleratorów, węzłami i projektami

    Te widoki wspierają decyzje dotyczące odzyskiwania zasobów, zmian limitów, polityk harmonogramowania oraz rozmieszczania obciążeń poza godzinami szczytu. Można również dodać czas zajętości pamięci, gdy dostępne są wymagane dane akceleratora i obciążenia, a klient zdefiniował metodę raportowania.

    Rozszerzony pomiar

    Rozszerzenie pomiaru GPU o dane Tokenów i koszty infrastruktury

    Godziny karty GPU stanowią podstawowy punkt odniesienia wykorzystania. Sensaka może również łączyć dodatkowe dane o zużyciu, gdy dostępne są odpowiednie źródła i etykiety.

    Wykorzystanie Tokenów

    Rejestrowanie wolumenu Tokenów, przepustowości, rozkładu modeli oraz rankingu wykorzystania usług dla obsługiwanych usług i bram wnioskowania.

    Wykorzystanie energii

    Wykorzystanie danych o zasilaniu urządzeń, szaf rack lub PDU jako danych wejściowych do uzgodnionego modelu alokacji energii.

    Wykorzystanie pamięci masowej

    Uwzględnienie zużycia pamięci masowej, gdy system pamięci masowej udostępnia odpowiednie przypisanie do projektu, dzierżawcy lub obciążenia.

    Koszt jednostkowy

    Zastosowanie stawek zdefiniowanych przez klienta w celu porównania kosztu wewnętrznego godzin karty GPU, typów akceleratorów, modeli lub projektów.

    Te rozszerzenia wymagają spójnych etykiet tożsamości i uzgodnionych zasad rozliczeniowych. Sensaka dostarcza podstawę danych operacyjnych, natomiast klient określa stawki finansowe, politykę alokacji i sposób ujęcia księgowego.

    Zarządzanie finansami

    Od pomiaru do showback i alokacji wewnętrznej

    Sensaka została zaprojektowana tak, aby wspierać kilka poziomów zarządzania finansami.

    01

    Raportowanie wykorzystania

    Prezentacja zużycia zasobów i bezczynnej pojemności według projektu, dzierżawcy, modelu i typu akceleratora.

    02

    Showback

    Zapewnienie zespołom przejrzystego widoku zużytych zasobów infrastruktury, bez generowania obciążenia finansowego.

    03

    Wewnętrzna alokacja kosztów

    Połączenie wykorzystania z uzgodnionymi stawkami w celu rozdzielenia kosztów infrastruktury między projekty lub działy.

    04

    Podstawa chargeback

    Dostarczenie szczegółowych, możliwych do prześledzenia rekordów wykorzystania, które można przekazać do wewnętrznego procesu rozliczeń lub finansów.

    Sensaka nie powinna być traktowana jako kompletny system fakturowania lub księgowości finansowej. Okresy rozliczeniowe, zestawienia rozliczeniowe, zatwierdzenia, zasady podatkowe i generowanie faktur mogą wymagać integracji z platformami i procesami finansowymi klienta.

    Przebieg pracy

    Praktyczny przebieg pomiaru

    01

    Rejestrowanie zdarzeń przydziału

    Zbieranie zdarzeń rozpoczęcia, zmiany i zwolnienia przydziału z harmonogramu obciążeń, środowiska Kubernetes lub platformy zarządzania zasobami.

    02

    Obliczanie wykorzystania równoważnego

    Przeliczanie przydziałów pełnych kart i zasobów partycjonowanych na uzgodnioną jednostkę godziny karty GPU.

    03

    Dodawanie etykiet biznesowych

    Powiązanie rekordu wykorzystania z projektem, dzierżawcą, modelem, usługą i typem akceleratora przy użyciu CMDB Sensaka oraz metadanych obciążenia.

    04

    Dodawanie kontekstu wykorzystania

    Porównanie przydzielonej pojemności z rzeczywistą aktywnością w celu zidentyfikowania zasobów bezczynnych lub niedostatecznie wykorzystywanych.

    05

    Agregacja i raportowanie

    Tworzenie dziennych, miesięcznych lub zdefiniowanych przez klienta podsumowań wykorzystania na potrzeby przeglądu projektów, zarządzania pojemnością i wewnętrznej alokacji kosztów.

    06

    Przegląd i uzgadnianie

    Umożliwienie właścicielom platformy, operacji i biznesu przeglądu podstawy wykorzystania, zanim trafi ona do procesu rozliczeń finansowych.

    Typowe zastosowania

    Gdzie sprawdza się pomiar wykorzystania GPU

    Showback platformy AI klasy enterprise

    Zapewnienie każdemu działowi miesięcznego widoku godzin karty GPU, typów akceleratorów, bezczynnego wykorzystania i powiązanego zużycia związanego z wnioskowaniem.

    Rozliczanie zasobów w publicznym centrum obliczeniowym

    Pomiar wykorzystania według dzierżawcy i projektu jako podstawa operacyjna dla rozliczeń usług i planowania pojemności.

    Alokacja klastra uniwersyteckiego i badawczego

    Śledzenie zużycia według grupy badawczej, grantu, projektu lub laboratorium przy jednoczesnym identyfikowaniu długotrwałych, bezczynnych rezerwacji.

    Porównanie kosztów modeli

    Porównanie zasobów GPU i Tokenów wykorzystywanych przez różne modele lub usługi wnioskowania, pod warunkiem spójnych etykiet i zasad kosztowych.

    Optymalizacja pojemności

    Wykorzystanie bezczynnych godzin karty GPU i rozkładu czasowego w celu określenia, kiedy zasoby można odzyskać, zmienić harmonogram lub udostępnić innym projektom.

    Planowanie budżetu

    Wykorzystanie historycznego zużycia według projektu i typu akceleratora do wspierania przyszłego planowania zasobów i zakupów.

    Kluczowe możliwości

    Wszystko, czego potrzebuje model pomiaru

    Obliczanie godzin karty GPU
    Proporcjonalny pomiar zasobów partycjonowanych
    Przypisanie wykorzystania według projektu i dzierżawcy
    Przypisanie wykorzystania według modelu i typu akceleratora
    Analiza wskaźnika bezczynności i bezczynnych godzin karty GPU
    Identyfikacja wysokiego przydziału i niskiego wykorzystania
    Analiza wykorzystania Tokenów i zużycia usług, tam gdzie jest to obsługiwane
    Dane wejściowe alokacji energii i pamięci masowej, o ile pozwalają na to dane źródłowe
    Porównanie kosztu jednostkowego przy użyciu stawek zdefiniowanych przez klienta
    Raporty wykorzystania na potrzeby showback i alokacji wewnętrznej
    Możliwe do prześledzenia rekordy wykorzystania na potrzeby uzgadniania i audytu
    Integracja z CMDB, harmonogramowaniem i procesami finansowymi klienta zgodnie z zakresem projektu
    Dlaczego Sensaka

    Pomiar oparty na rzeczywistej infrastrukturze

    Sensaka łączy pomiar z fizyczną i logiczną infrastrukturą stojącą za rekordem wykorzystania. Platforma może powiązać projekt z jego obciążeniem, kontenerem, GPU, węzłem, modelem akceleratora i kontekstem infrastruktury. Dzięki temu powstaje rekord wykorzystania łatwiejszy do obrony niż izolowane średnie wykorzystania.

    Sensaka łączy również pomiar godzin karty GPU z analizą bezczynności, aktywnością Tokenów i danymi infrastruktury, pomagając zespołom analizować zarówno alokację kosztów, jak i efektywność operacyjną.

    Aspekty wdrożenia

    Uzgodnienie zasad, zanim raporty zaczną wpływać na decyzje

    Klient i Sensaka powinni wspólnie ustalić:

    01Kiedy przydział się rozpoczyna i kończy
    02Jak traktowane są obciążenia zakończone niepowodzeniem, wstrzymane i oczekujące w kolejce
    03Jak ważone są partycje GPU i wirtualne akceleratory
    04Który system dostarcza tożsamość projektu i dzierżawcy
    05Jak grupowane i wyceniane są modele akceleratorów
    06Jak definiowane jest wykorzystanie bezczynne
    07Czy energia i pamięć masowa są alokowane bezpośrednio, czy proporcjonalnie
    08Okresy raportowania i procedury uzgadniania
    09Który system finansowy otrzymuje ostateczne rekordy wykorzystania
    FAQ

    Najczęściej zadawane pytania

    Czym jest godzina karty GPU?

    Godzina karty GPU oznacza jedną pełną kartę akceleratora przydzieloną na jedną godzinę. Liczba kart i czas trwania przydziału są ze sobą mnożone. Zasoby partycjonowane można przeliczać proporcjonalnie przy użyciu uzgodnionej zasady ważenia.

    Czy Sensaka mierzy rzeczywiste wykorzystanie, czy tylko przydział?

    Sensaka wykorzystuje rekordy przydziału jako podstawę pomiaru i dodaje kontekst wykorzystania, aby zidentyfikować zasoby bezczynne lub niedostatecznie wykorzystywane. Ujęcie finansowe powinno być zgodne z uzgodnioną polityką klienta.

    Czy Sensaka może mierzyć współdzielone lub partycjonowane GPU?

    Tak, o ile platforma zasobów udostępnia wymagane dane o przydziale. MIG, wirtualne GPU i inne typy partycji wymagają zdefiniowanego modelu ważenia proporcjonalnego.

    Czy jest to kompletna platforma rozliczeniowa?

    Nie. Sensaka zapewnia pomiar wykorzystania, showback, dane wejściowe do wewnętrznej alokacji kosztów oraz rekordy możliwe do prześledzenia. Formalne fakturowanie, obsługa podatkowa i księgowość finansowa zwykle pozostają w systemach rozliczeniowych lub finansowych klienta.

    Czy koszty można rozdzielić według modelu GPU?

    Tak. Wykorzystanie można grupować według typu akceleratora i łączyć ze stawkami wewnętrznymi zdefiniowanymi przez klienta.

    Czy można uwzględnić zużycie Tokenów?

    Zużycie Tokenów można uwzględnić, gdy brama wnioskowania lub platforma udostępniania modeli rejestruje Tokeny wejściowe i wyjściowe oraz udostępnia etykiety modelu, dzierżawcy i projektu.

    Czy koszty energii można alokować do projektów?

    Dane o energii można uwzględnić przy użyciu uzgodnionej metody alokacji. Dokładna alokacja na poziomie projektu wymaga wiarygodnej zależności między wykorzystaniem obciążenia a danymi o zasilaniu urządzenia lub szafy rack.

    Rozpocznij

    Widoczne i rozliczalne zużycie GPU

    Stworzenie wiarygodnego rekordu wykorzystania dla każdego projektu, dzierżawcy i klasy akceleratora, a następnie wykorzystanie go do poprawy wykorzystania i wsparcia wewnętrznych decyzji kosztowych.

    Powiązane: Obserwowalność infrastruktury AI, CMDB infrastruktury AI, Monitoring chłodzenia cieczą