Pomiar wykorzystania GPU i alokacja kosztów
Zrozumienie, kto korzysta z mocy GPU, ile zużywa i gdzie kosztowne zasoby pozostają bezczynne.
Sensaka mierzy wykorzystanie akceleratorów w projektach, u dzierżawców, w modelach i typach GPU. Przekształca dane harmonogramowania i infrastruktury w możliwe do prześledzenia rekordy godzin karty GPU, widoki wykorzystania oraz dane wejściowe do alokacji kosztów dla platform AI klasy enterprise, współdzielonych centrów obliczeniowych i środowisk badawczych.
Współdzielona infrastruktura GPU wymaga wspólnego rekordu wykorzystania
Gdy kilka zespołów współdzieli to samo środowisko GPU, sam przydział nie wyjaśnia zużycia. Jeden projekt może rezerwować kilka GPU, ale wykorzystywać je w niewielkim stopniu. Inny zespół może wykorzystywać partycjonowane akceleratory do krótkich obciążeń wnioskowania. Zadania związane z trenowaniem, pracami programistycznymi i wnioskowaniem mogą korzystać z różnych modeli GPU o różnych wewnętrznych stawkach kosztowych. Zużycie energii, pamięci masowej i Tokenów może również wymagać powiązania z tym samym projektem.
Bez spójnego modelu pomiaru zespoły infrastruktury mają trudności z odpowiedzią na pytania:
Sensaka tworzy rekordy wykorzystania potrzebne do odpowiedzi na te pytania.
Pomiar godzin karty GPU
Podstawową jednostką pomiaru Sensaka jest godzina karty GPU. Godziny karty GPU oblicza się jako:
Godziny karty GPU = liczba przydzielonych kart × czas trwania przydziału
W przypadku partycjonowanych lub wirtualnych zasobów akceleratorów wykorzystanie można przeliczać proporcjonalnie zgodnie z uzgodnioną wagą partycji. Tworzy to spójny punkt odniesienia do porównywania obciążeń wykorzystujących różną liczbę akceleratorów przez różny czas.
Polityka pomiaru powinna zostać potwierdzona podczas wdrożenia, zwłaszcza gdy stosowane są różne technologie partycjonowania i różni producenci akceleratorów.
Przypisanie wykorzystania do właściwego wymiaru biznesowego
Sensaka może organizować zmierzone wykorzystanie w czterech głównych wymiarach alokacji.
Projekt
Zrozumienie, ile mocy GPU zużywa każdy projekt AI, oraz porównanie wykorzystania w działaniach związanych z trenowaniem, wnioskowaniem i pracami programistycznymi.
Dzierżawca lub zespół
Widoki wykorzystania dla działów, grup badawczych, klientów lub wewnętrznych dzierżawców platformy współdzielących infrastrukturę.
Model lub usługa
Powiązanie wykorzystania zasobów z modelem, usługą wnioskowania lub kategorią obciążenia, gdy dostępne są odpowiednie etykiety usługi i obciążenia.
Typ akceleratora
Rozdzielenie zużycia według modelu GPU lub NPU, aby organizacje mogły porównywać wykorzystanie i koszt w różnych klasach sprzętu.
Wymiary te dają zespołom finansowym, platformowym i infrastruktury wspólną strukturę do analizy.
Identyfikacja bezczynnej i niedostatecznie wykorzystywanej pojemności
Przydzielona pojemność nie zawsze jest pojemnością produktywną. Sensaka łączy rekordy harmonogramowania z danymi o wykorzystaniu, aby pomóc zespołom zidentyfikować:
Te widoki wspierają decyzje dotyczące odzyskiwania zasobów, zmian limitów, polityk harmonogramowania oraz rozmieszczania obciążeń poza godzinami szczytu. Można również dodać czas zajętości pamięci, gdy dostępne są wymagane dane akceleratora i obciążenia, a klient zdefiniował metodę raportowania.
Rozszerzenie pomiaru GPU o dane Tokenów i koszty infrastruktury
Godziny karty GPU stanowią podstawowy punkt odniesienia wykorzystania. Sensaka może również łączyć dodatkowe dane o zużyciu, gdy dostępne są odpowiednie źródła i etykiety.
Wykorzystanie Tokenów
Rejestrowanie wolumenu Tokenów, przepustowości, rozkładu modeli oraz rankingu wykorzystania usług dla obsługiwanych usług i bram wnioskowania.
Wykorzystanie energii
Wykorzystanie danych o zasilaniu urządzeń, szaf rack lub PDU jako danych wejściowych do uzgodnionego modelu alokacji energii.
Wykorzystanie pamięci masowej
Uwzględnienie zużycia pamięci masowej, gdy system pamięci masowej udostępnia odpowiednie przypisanie do projektu, dzierżawcy lub obciążenia.
Koszt jednostkowy
Zastosowanie stawek zdefiniowanych przez klienta w celu porównania kosztu wewnętrznego godzin karty GPU, typów akceleratorów, modeli lub projektów.
Te rozszerzenia wymagają spójnych etykiet tożsamości i uzgodnionych zasad rozliczeniowych. Sensaka dostarcza podstawę danych operacyjnych, natomiast klient określa stawki finansowe, politykę alokacji i sposób ujęcia księgowego.
Od pomiaru do showback i alokacji wewnętrznej
Sensaka została zaprojektowana tak, aby wspierać kilka poziomów zarządzania finansami.
Raportowanie wykorzystania
Prezentacja zużycia zasobów i bezczynnej pojemności według projektu, dzierżawcy, modelu i typu akceleratora.
Showback
Zapewnienie zespołom przejrzystego widoku zużytych zasobów infrastruktury, bez generowania obciążenia finansowego.
Wewnętrzna alokacja kosztów
Połączenie wykorzystania z uzgodnionymi stawkami w celu rozdzielenia kosztów infrastruktury między projekty lub działy.
Podstawa chargeback
Dostarczenie szczegółowych, możliwych do prześledzenia rekordów wykorzystania, które można przekazać do wewnętrznego procesu rozliczeń lub finansów.
Sensaka nie powinna być traktowana jako kompletny system fakturowania lub księgowości finansowej. Okresy rozliczeniowe, zestawienia rozliczeniowe, zatwierdzenia, zasady podatkowe i generowanie faktur mogą wymagać integracji z platformami i procesami finansowymi klienta.
Praktyczny przebieg pomiaru
Rejestrowanie zdarzeń przydziału
Zbieranie zdarzeń rozpoczęcia, zmiany i zwolnienia przydziału z harmonogramu obciążeń, środowiska Kubernetes lub platformy zarządzania zasobami.
Obliczanie wykorzystania równoważnego
Przeliczanie przydziałów pełnych kart i zasobów partycjonowanych na uzgodnioną jednostkę godziny karty GPU.
Dodawanie etykiet biznesowych
Powiązanie rekordu wykorzystania z projektem, dzierżawcą, modelem, usługą i typem akceleratora przy użyciu CMDB Sensaka oraz metadanych obciążenia.
Dodawanie kontekstu wykorzystania
Porównanie przydzielonej pojemności z rzeczywistą aktywnością w celu zidentyfikowania zasobów bezczynnych lub niedostatecznie wykorzystywanych.
Agregacja i raportowanie
Tworzenie dziennych, miesięcznych lub zdefiniowanych przez klienta podsumowań wykorzystania na potrzeby przeglądu projektów, zarządzania pojemnością i wewnętrznej alokacji kosztów.
Przegląd i uzgadnianie
Umożliwienie właścicielom platformy, operacji i biznesu przeglądu podstawy wykorzystania, zanim trafi ona do procesu rozliczeń finansowych.
Gdzie sprawdza się pomiar wykorzystania GPU
Showback platformy AI klasy enterprise
Zapewnienie każdemu działowi miesięcznego widoku godzin karty GPU, typów akceleratorów, bezczynnego wykorzystania i powiązanego zużycia związanego z wnioskowaniem.
Rozliczanie zasobów w publicznym centrum obliczeniowym
Pomiar wykorzystania według dzierżawcy i projektu jako podstawa operacyjna dla rozliczeń usług i planowania pojemności.
Alokacja klastra uniwersyteckiego i badawczego
Śledzenie zużycia według grupy badawczej, grantu, projektu lub laboratorium przy jednoczesnym identyfikowaniu długotrwałych, bezczynnych rezerwacji.
Porównanie kosztów modeli
Porównanie zasobów GPU i Tokenów wykorzystywanych przez różne modele lub usługi wnioskowania, pod warunkiem spójnych etykiet i zasad kosztowych.
Optymalizacja pojemności
Wykorzystanie bezczynnych godzin karty GPU i rozkładu czasowego w celu określenia, kiedy zasoby można odzyskać, zmienić harmonogram lub udostępnić innym projektom.
Planowanie budżetu
Wykorzystanie historycznego zużycia według projektu i typu akceleratora do wspierania przyszłego planowania zasobów i zakupów.
Wszystko, czego potrzebuje model pomiaru
Pomiar oparty na rzeczywistej infrastrukturze
Sensaka łączy pomiar z fizyczną i logiczną infrastrukturą stojącą za rekordem wykorzystania. Platforma może powiązać projekt z jego obciążeniem, kontenerem, GPU, węzłem, modelem akceleratora i kontekstem infrastruktury. Dzięki temu powstaje rekord wykorzystania łatwiejszy do obrony niż izolowane średnie wykorzystania.
Sensaka łączy również pomiar godzin karty GPU z analizą bezczynności, aktywnością Tokenów i danymi infrastruktury, pomagając zespołom analizować zarówno alokację kosztów, jak i efektywność operacyjną.
Uzgodnienie zasad, zanim raporty zaczną wpływać na decyzje
Klient i Sensaka powinni wspólnie ustalić:
Najczęściej zadawane pytania
Czym jest godzina karty GPU?
Godzina karty GPU oznacza jedną pełną kartę akceleratora przydzieloną na jedną godzinę. Liczba kart i czas trwania przydziału są ze sobą mnożone. Zasoby partycjonowane można przeliczać proporcjonalnie przy użyciu uzgodnionej zasady ważenia.
Czy Sensaka mierzy rzeczywiste wykorzystanie, czy tylko przydział?
Sensaka wykorzystuje rekordy przydziału jako podstawę pomiaru i dodaje kontekst wykorzystania, aby zidentyfikować zasoby bezczynne lub niedostatecznie wykorzystywane. Ujęcie finansowe powinno być zgodne z uzgodnioną polityką klienta.
Czy Sensaka może mierzyć współdzielone lub partycjonowane GPU?
Tak, o ile platforma zasobów udostępnia wymagane dane o przydziale. MIG, wirtualne GPU i inne typy partycji wymagają zdefiniowanego modelu ważenia proporcjonalnego.
Czy jest to kompletna platforma rozliczeniowa?
Nie. Sensaka zapewnia pomiar wykorzystania, showback, dane wejściowe do wewnętrznej alokacji kosztów oraz rekordy możliwe do prześledzenia. Formalne fakturowanie, obsługa podatkowa i księgowość finansowa zwykle pozostają w systemach rozliczeniowych lub finansowych klienta.
Czy koszty można rozdzielić według modelu GPU?
Tak. Wykorzystanie można grupować według typu akceleratora i łączyć ze stawkami wewnętrznymi zdefiniowanymi przez klienta.
Czy można uwzględnić zużycie Tokenów?
Zużycie Tokenów można uwzględnić, gdy brama wnioskowania lub platforma udostępniania modeli rejestruje Tokeny wejściowe i wyjściowe oraz udostępnia etykiety modelu, dzierżawcy i projektu.
Czy koszty energii można alokować do projektów?
Dane o energii można uwzględnić przy użyciu uzgodnionej metody alokacji. Dokładna alokacja na poziomie projektu wymaga wiarygodnej zależności między wykorzystaniem obciążenia a danymi o zasilaniu urządzenia lub szafy rack.
Widoczne i rozliczalne zużycie GPU
Stworzenie wiarygodnego rekordu wykorzystania dla każdego projektu, dzierżawcy i klasy akceleratora, a następnie wykorzystanie go do poprawy wykorzystania i wsparcia wewnętrznych decyzji kosztowych.
Powiązane: Obserwowalność infrastruktury AI, CMDB infrastruktury AI, Monitoring chłodzenia cieczą
