Wykrywanie gorących punktów termicznych w szafach GPU
Gorący punkt termiczny to lokalny obszar, w którym produkcja ciepła wyprzedziła ilość docierającego tam powietrza lub cieczy chłodzącej. W konwencjonalnej szafie średnia dla pomieszczenia zwykle dość dobrze odzwierciedla to, czego doświadcza każdy serwer. W szafie GPU tak nie jest: ciepło koncentruje się w kilku jednostkach szafy, pojawia się skokowo wraz z uruchamianiem zadań, a pojedyncza obudowa może być w tarapatach, mimo że pomieszczenie wskazuje normalne wartości. Wykrywanie polega na porównywaniu odpowiednich sygnałów ze sobą, a nie na obserwowaniu, czy jedna liczba przekroczy próg.
Dlaczego w gęstych szafach GPU powstają gorące punkty
Szafy AI działają przy gęstościach mocy, do których starsze pomieszczenia nie zostały zaprojektowane. Skutki mają charakter fizyczny i lokalny, dlatego umykają panelom na poziomie pomieszczenia.
Gęstość mocy skoncentrowana w kilku jednostkach szafy
Obudowa z akceleratorami może pobierać więcej mocy w 8U niż konwencjonalna szafa pobierała w 42U. Ciepło powstaje w niewielkiej objętości, więc margines między normalnym a granicznym przepływem powietrza jest wąski.
Przepływ powietrza zaprojektowany dla innej szafy
Obudowanie przepływu, płyty podłogowe, panele maskujące i rozmieszczenie klimatyzatorów CRAC są zwykle projektowane wokół średniej mocy kW na szafę. Gdy w takim układzie pojawia się gęsta obudowa GPU, powietrze, którego potrzebuje, nie zawsze jest tym, które otrzymuje.
Zsynchronizowane obciążenie w całym klastrze
Trening rozproszony wymusza na każdym węźle zadania podobne wykorzystanie w tym samym momencie. Obciążenie termiczne pojawia się jako skokowa zmiana w całym rzędzie, a nie jako rozproszone szczyty.
Mieszane chłodzenie w tym samym pomieszczeniu
Bezpośrednie obiegi cieczy chłodzącej (direct-to-chip) odprowadzają ciepło z akceleratorów, ale zasilacze, pamięć i karty sieciowe często wciąż są chłodzone powietrzem. Szafa może wyglądać dobrze pod względem temperatury cieczy chłodzącej, a mimo to być gorąca w korytarzu.
Telemetria ujawniająca gorący punkt
Żaden pojedynczy odczyt nie identyfikuje gorącego punktu. Robi to pięć źródeł, odczytywanych razem i zsynchronizowanych w czasie.
Temperatura na wlocie i wylocie
Różnica między powietrzem dostarczanym a powietrzem powrotnym przy każdej obudowie to pierwszy użyteczny sygnał. Rosnąca różnica przy stabilnej temperaturze wlotowej zwykle oznacza, że sprzęt pracuje ciężej; rosnąca temperatura wlotowa oznacza, że problemem jest pomieszczenie, obudowanie przepływu lub jednostka chłodząca, a nie serwer.
Czujniki termiczne BMC
Kontroler zarządzania płytą główną udostępnia temperatury płyty, procesora, pamięci i akceleratora, prędkości wentylatorów, awarie wentylatorów oraz stan ograniczania termicznego (throttling). Ponieważ dane są odczytywane out-of-band, nadal napływają, gdy system operacyjny się zawiesza lub węzeł wypada z harmonogramu zadań.
Pobór mocy na szafę
Odczyty z PDU i obwodów odgałęźnych pokazują, gdzie faktycznie powstaje ciepło. Szafa pobierająca moc bliską limitowi obwodu wytwarza obciążenie termiczne bliskie maksymalnemu, i to właśnie tam najpierw powstają gorące punkty.
Temperatury obiegu chłodzenia cieczą
Temperatury zasilania i powrotu cieczy chłodzącej, różnica ciśnień oraz dostępny przepływ z jednostki CDU wskazują, czy obieg odprowadza tyle ciepła, ile wprowadzają szafy. Rosnąca temperatura powrotu przy stabilnej temperaturze zasilania wskazuje na obciążenie; jeśli rosną obie, problem leży w obiegu.
Czujniki środowiskowe pomieszczenia i strefy
Czujniki temperatury i wilgotności w korytarzu dostarczają kontekstu, którego nie da pojedynczy odczyt obudowy: czy nietypowa jest jedna maszyna, czy przesunął się cały rząd.
Jak odczytywać sygnały
Porównuj, nie ustalaj progów
Stały alarm temperaturowy uruchamia się późno i wszędzie naraz. Porównywanie każdej obudowy z sąsiednimi w tej samej szafie oraz każdej szafy z innymi w rzędzie ujawnia odstępstwo na długo przed osiągnięciem wartości granicznej.
Zestaw dane termiczne i o zasilaniu na jednej osi czasu
Sama temperatura nie pozwala odróżnić awarii chłodzenia od zmiany obciążenia. Zestawiona z poborem mocy szafy i wykorzystaniem akceleratora, kolejność zdarzeń zwykle daje odpowiedź: najpierw moc, potem ciepło oznacza obciążenie; najpierw ciepło bez zmiany mocy oznacza problem z przepływem powietrza lub cieczą chłodzącą.
Obserwuj throttling i zachowanie wentylatorów, nie tylko stopnie
Wentylatory pracujące stale na maksimum i akceleratory zgłaszające ograniczanie termiczne to sprzęt informujący, że już kompensuje sytuację. Oba sygnały pojawiają się, zanim odczyt temperatury zacznie wyglądać alarmująco.
Przypisanie do lokalizacji i właściciela
Gorący punkt staje się możliwy do obsłużenia dopiero wtedy, gdy zostanie przypisany do szafy, pozycji U, strefy chłodzenia i zespołu za nią odpowiedzialnego, wraz z listą dotkniętych zadań i usług.
Jak Sensaka DCOS ujawnia ryzyko termiczne szafy
DCOS zbiera dane termiczne obudowy w sposób bezagentowy z kontrolera zarządzania płytą główną przez IPMI, Redfish, iDRAC, iLO i iBMC, w serwerach i obudowach GPU wielu dostawców. Temperatury płyty, procesora, pamięci i akceleratora docierają wraz z prędkością wentylatorów, stanem ich awarii, obciążeniem zasilacza i wskaźnikami ograniczania termicznego, i nadal napływają, gdy system operacyjny nie odpowiada. To różnica między wiedzą, że węzeł się przegrzał, a zgadywaniem, dlaczego zniknął.
Te odczyty są zestawiane z danymi PDU, obwodów odgałęźnych i UPS dla tej samej szafy, czujnikami środowiskowymi pomieszczenia i korytarza oraz — jeśli sprzęt to udostępnia — stanem CDU wraz z temperaturą zasilania i powrotu cieczy, różnicą ciśnień i wskaźnikami przepływu. Każdy pomiar jest przypisany do obiektu, pomieszczenia, strefy chłodzenia, szafy i pozycji U, dzięki czemu nieprawidłowa obudowa jest odczytywana względem sąsiadów, a nie średniej dla pomieszczenia.
Operacyjną korzyścią jest zakres. Gdy pojawia się gorący punkt, platforma może pokazać, które szafy współdzielą strefę chłodzenia, jaki sprzęt znajduje się w dotkniętych jednostkach, które akceleratory ograniczają wydajność i jakie obciążenia od nich zależą, dzięki czemu reakcję można priorytetyzować, zamiast prowadzić dochodzenie od zera. Powiązane strony funkcjonalne: monitoring infrastruktury GPU dla warstwy obudowy oraz monitoring chłodzenia cieczą dla warstwy obiegu i obiektu.
Wiarygodne źródła
Najczęstsze pytania o gorące punkty w szafach GPU
Co powoduje gorące punkty termiczne w szafach GPU?
Gorące punkty powstają tam, gdzie produkcja ciepła wyprzedza ilość powietrza lub cieczy chłodzącej dostarczaną w to miejsce. W szafach GPU typowe przyczyny to gęstość mocy skoncentrowana w kilku jednostkach szafy, przepływ powietrza i obudowanie zaprojektowane wokół niższej średniej mocy kW na szafę, zsynchronizowane obciążenie węzłów w zadaniu treningu rozproszonego, zablokowane lub uszkodzone wentylatory oraz mieszane chłodzenie, w którym akceleratory są chłodzone cieczą, a pozostałe komponenty wciąż powietrzem.
Jaka telemetria ujawnia gorący punkt, zanim spowoduje awarię?
Temperatura powietrza na wlocie i wylocie każdej obudowy, czujniki termiczne BMC obejmujące odczyty płyty, procesora, pamięci i akceleratora, prędkość wentylatorów i stan ich awarii, flagi ograniczania termicznego, pobór mocy na szafę z PDU i obwodów odgałęźnych, a w rzędach chłodzonych cieczą — temperatura zasilania i powrotu cieczy wraz z różnicą ciśnień i wskaźnikami przepływu.
Dlaczego monitoring out-of-band jest ważny dla wykrywania zjawisk termicznych?
Narzędzia oparte na agentach zależą od sprawnego systemu operacyjnego. Węzeł, który się przegrzewa, mocno ogranicza wydajność lub zawiesza się, często przestaje raportować dokładnie w momencie, gdy dane termiczne mają największe znaczenie. Odczyt kontrolera zarządzania płytą główną przez IPMI lub Redfish utrzymuje strumień danych z czujników niezależnie od systemu operacyjnego.
Jak odróżnić problem z chłodzeniem od problemu z obciążeniem?
Sprawdź kolejność zdarzeń. Jeśli pobór mocy szafy rośnie jako pierwszy, a temperatura podąża za nim, zmieniło się obciążenie. Jeśli temperatura rośnie, a moc pozostaje stała, ciepło nie jest odprowadzane, co wskazuje na przepływ powietrza, wentylator, lukę w obudowaniu lub obieg chłodzenia. Temperatura wlotowa dodatkowo to rozróżnia: jej wzrost to stan pomieszczenia lub jednostki chłodzącej, a nie serwera.
Czy chłodzenie cieczą eliminuje problem gorących punktów?
Zmienia go. Obiegi direct-to-chip zajmują się ciepłem akceleratora, ale zasilacze, pamięć i komponenty sieciowe w tej samej obudowie często wciąż są chłodzone powietrzem, a sam obieg staje się czymś, co trzeba monitorować: temperaturę zasilania i powrotu, różnicę ciśnień, dostępny przepływ oraz zdarzenia wycieków. Zespoły stosujące chłodzenie mieszane potrzebują obrazu zarówno strony powietrznej, jak i obiegowej.
Jak Sensaka ujawnia gorące punkty w szafach GPU?
Sensaka DCOS zbiera dane termiczne obudowy, stan wentylatorów i kondycję akceleratora w sposób bezagentowy przez interfejsy BMC, takie jak IPMI, Redfish, iDRAC, iLO i iBMC, i łączy je z danymi o mocy z PDU i UPS, czujnikami środowiskowymi oraz obsługiwaną telemetrią chłodzenia cieczą. Te odczyty są uporządkowane według obiektu, pomieszczenia, strefy chłodzenia, szafy i pozycji U, dzięki czemu nieprawidłowa obudowa jest pokazywana w kontekście otaczającej ją szafy i rzędu.
