Zasób · Infrastruktura AI

    Wykrywanie gorących punktów termicznych w szafach GPU

    Gorący punkt termiczny to lokalny obszar, w którym produkcja ciepła wyprzedziła ilość docierającego tam powietrza lub cieczy chłodzącej. W konwencjonalnej szafie średnia dla pomieszczenia zwykle dość dobrze odzwierciedla to, czego doświadcza każdy serwer. W szafie GPU tak nie jest: ciepło koncentruje się w kilku jednostkach szafy, pojawia się skokowo wraz z uruchamianiem zadań, a pojedyncza obudowa może być w tarapatach, mimo że pomieszczenie wskazuje normalne wartości. Wykrywanie polega na porównywaniu odpowiednich sygnałów ze sobą, a nie na obserwowaniu, czy jedna liczba przekroczy próg.

    Mechanizm

    Dlaczego w gęstych szafach GPU powstają gorące punkty

    Szafy AI działają przy gęstościach mocy, do których starsze pomieszczenia nie zostały zaprojektowane. Skutki mają charakter fizyczny i lokalny, dlatego umykają panelom na poziomie pomieszczenia.

    Gęstość mocy skoncentrowana w kilku jednostkach szafy

    Obudowa z akceleratorami może pobierać więcej mocy w 8U niż konwencjonalna szafa pobierała w 42U. Ciepło powstaje w niewielkiej objętości, więc margines między normalnym a granicznym przepływem powietrza jest wąski.

    Przepływ powietrza zaprojektowany dla innej szafy

    Obudowanie przepływu, płyty podłogowe, panele maskujące i rozmieszczenie klimatyzatorów CRAC są zwykle projektowane wokół średniej mocy kW na szafę. Gdy w takim układzie pojawia się gęsta obudowa GPU, powietrze, którego potrzebuje, nie zawsze jest tym, które otrzymuje.

    Zsynchronizowane obciążenie w całym klastrze

    Trening rozproszony wymusza na każdym węźle zadania podobne wykorzystanie w tym samym momencie. Obciążenie termiczne pojawia się jako skokowa zmiana w całym rzędzie, a nie jako rozproszone szczyty.

    Mieszane chłodzenie w tym samym pomieszczeniu

    Bezpośrednie obiegi cieczy chłodzącej (direct-to-chip) odprowadzają ciepło z akceleratorów, ale zasilacze, pamięć i karty sieciowe często wciąż są chłodzone powietrzem. Szafa może wyglądać dobrze pod względem temperatury cieczy chłodzącej, a mimo to być gorąca w korytarzu.

    Co zbierać

    Telemetria ujawniająca gorący punkt

    Żaden pojedynczy odczyt nie identyfikuje gorącego punktu. Robi to pięć źródeł, odczytywanych razem i zsynchronizowanych w czasie.

    Temperatura na wlocie i wylocie

    Różnica między powietrzem dostarczanym a powietrzem powrotnym przy każdej obudowie to pierwszy użyteczny sygnał. Rosnąca różnica przy stabilnej temperaturze wlotowej zwykle oznacza, że sprzęt pracuje ciężej; rosnąca temperatura wlotowa oznacza, że problemem jest pomieszczenie, obudowanie przepływu lub jednostka chłodząca, a nie serwer.

    Czujniki termiczne BMC

    Kontroler zarządzania płytą główną udostępnia temperatury płyty, procesora, pamięci i akceleratora, prędkości wentylatorów, awarie wentylatorów oraz stan ograniczania termicznego (throttling). Ponieważ dane są odczytywane out-of-band, nadal napływają, gdy system operacyjny się zawiesza lub węzeł wypada z harmonogramu zadań.

    Pobór mocy na szafę

    Odczyty z PDU i obwodów odgałęźnych pokazują, gdzie faktycznie powstaje ciepło. Szafa pobierająca moc bliską limitowi obwodu wytwarza obciążenie termiczne bliskie maksymalnemu, i to właśnie tam najpierw powstają gorące punkty.

    Temperatury obiegu chłodzenia cieczą

    Temperatury zasilania i powrotu cieczy chłodzącej, różnica ciśnień oraz dostępny przepływ z jednostki CDU wskazują, czy obieg odprowadza tyle ciepła, ile wprowadzają szafy. Rosnąca temperatura powrotu przy stabilnej temperaturze zasilania wskazuje na obciążenie; jeśli rosną obie, problem leży w obiegu.

    Czujniki środowiskowe pomieszczenia i strefy

    Czujniki temperatury i wilgotności w korytarzu dostarczają kontekstu, którego nie da pojedynczy odczyt obudowy: czy nietypowa jest jedna maszyna, czy przesunął się cały rząd.

    Metoda

    Jak odczytywać sygnały

    01

    Porównuj, nie ustalaj progów

    Stały alarm temperaturowy uruchamia się późno i wszędzie naraz. Porównywanie każdej obudowy z sąsiednimi w tej samej szafie oraz każdej szafy z innymi w rzędzie ujawnia odstępstwo na długo przed osiągnięciem wartości granicznej.

    02

    Zestaw dane termiczne i o zasilaniu na jednej osi czasu

    Sama temperatura nie pozwala odróżnić awarii chłodzenia od zmiany obciążenia. Zestawiona z poborem mocy szafy i wykorzystaniem akceleratora, kolejność zdarzeń zwykle daje odpowiedź: najpierw moc, potem ciepło oznacza obciążenie; najpierw ciepło bez zmiany mocy oznacza problem z przepływem powietrza lub cieczą chłodzącą.

    03

    Obserwuj throttling i zachowanie wentylatorów, nie tylko stopnie

    Wentylatory pracujące stale na maksimum i akceleratory zgłaszające ograniczanie termiczne to sprzęt informujący, że już kompensuje sytuację. Oba sygnały pojawiają się, zanim odczyt temperatury zacznie wyglądać alarmująco.

    04

    Przypisanie do lokalizacji i właściciela

    Gorący punkt staje się możliwy do obsłużenia dopiero wtedy, gdy zostanie przypisany do szafy, pozycji U, strefy chłodzenia i zespołu za nią odpowiedzialnego, wraz z listą dotkniętych zadań i usług.

    W praktyce

    Jak Sensaka DCOS ujawnia ryzyko termiczne szafy

    DCOS zbiera dane termiczne obudowy w sposób bezagentowy z kontrolera zarządzania płytą główną przez IPMI, Redfish, iDRAC, iLO i iBMC, w serwerach i obudowach GPU wielu dostawców. Temperatury płyty, procesora, pamięci i akceleratora docierają wraz z prędkością wentylatorów, stanem ich awarii, obciążeniem zasilacza i wskaźnikami ograniczania termicznego, i nadal napływają, gdy system operacyjny nie odpowiada. To różnica między wiedzą, że węzeł się przegrzał, a zgadywaniem, dlaczego zniknął.

    Te odczyty są zestawiane z danymi PDU, obwodów odgałęźnych i UPS dla tej samej szafy, czujnikami środowiskowymi pomieszczenia i korytarza oraz — jeśli sprzęt to udostępnia — stanem CDU wraz z temperaturą zasilania i powrotu cieczy, różnicą ciśnień i wskaźnikami przepływu. Każdy pomiar jest przypisany do obiektu, pomieszczenia, strefy chłodzenia, szafy i pozycji U, dzięki czemu nieprawidłowa obudowa jest odczytywana względem sąsiadów, a nie średniej dla pomieszczenia.

    Operacyjną korzyścią jest zakres. Gdy pojawia się gorący punkt, platforma może pokazać, które szafy współdzielą strefę chłodzenia, jaki sprzęt znajduje się w dotkniętych jednostkach, które akceleratory ograniczają wydajność i jakie obciążenia od nich zależą, dzięki czemu reakcję można priorytetyzować, zamiast prowadzić dochodzenie od zera. Powiązane strony funkcjonalne: monitoring infrastruktury GPU dla warstwy obudowy oraz monitoring chłodzenia cieczą dla warstwy obiegu i obiektu.

    FAQ

    Najczęstsze pytania o gorące punkty w szafach GPU

    Co powoduje gorące punkty termiczne w szafach GPU?

    Gorące punkty powstają tam, gdzie produkcja ciepła wyprzedza ilość powietrza lub cieczy chłodzącej dostarczaną w to miejsce. W szafach GPU typowe przyczyny to gęstość mocy skoncentrowana w kilku jednostkach szafy, przepływ powietrza i obudowanie zaprojektowane wokół niższej średniej mocy kW na szafę, zsynchronizowane obciążenie węzłów w zadaniu treningu rozproszonego, zablokowane lub uszkodzone wentylatory oraz mieszane chłodzenie, w którym akceleratory są chłodzone cieczą, a pozostałe komponenty wciąż powietrzem.

    Jaka telemetria ujawnia gorący punkt, zanim spowoduje awarię?

    Temperatura powietrza na wlocie i wylocie każdej obudowy, czujniki termiczne BMC obejmujące odczyty płyty, procesora, pamięci i akceleratora, prędkość wentylatorów i stan ich awarii, flagi ograniczania termicznego, pobór mocy na szafę z PDU i obwodów odgałęźnych, a w rzędach chłodzonych cieczą — temperatura zasilania i powrotu cieczy wraz z różnicą ciśnień i wskaźnikami przepływu.

    Dlaczego monitoring out-of-band jest ważny dla wykrywania zjawisk termicznych?

    Narzędzia oparte na agentach zależą od sprawnego systemu operacyjnego. Węzeł, który się przegrzewa, mocno ogranicza wydajność lub zawiesza się, często przestaje raportować dokładnie w momencie, gdy dane termiczne mają największe znaczenie. Odczyt kontrolera zarządzania płytą główną przez IPMI lub Redfish utrzymuje strumień danych z czujników niezależnie od systemu operacyjnego.

    Jak odróżnić problem z chłodzeniem od problemu z obciążeniem?

    Sprawdź kolejność zdarzeń. Jeśli pobór mocy szafy rośnie jako pierwszy, a temperatura podąża za nim, zmieniło się obciążenie. Jeśli temperatura rośnie, a moc pozostaje stała, ciepło nie jest odprowadzane, co wskazuje na przepływ powietrza, wentylator, lukę w obudowaniu lub obieg chłodzenia. Temperatura wlotowa dodatkowo to rozróżnia: jej wzrost to stan pomieszczenia lub jednostki chłodzącej, a nie serwera.

    Czy chłodzenie cieczą eliminuje problem gorących punktów?

    Zmienia go. Obiegi direct-to-chip zajmują się ciepłem akceleratora, ale zasilacze, pamięć i komponenty sieciowe w tej samej obudowie często wciąż są chłodzone powietrzem, a sam obieg staje się czymś, co trzeba monitorować: temperaturę zasilania i powrotu, różnicę ciśnień, dostępny przepływ oraz zdarzenia wycieków. Zespoły stosujące chłodzenie mieszane potrzebują obrazu zarówno strony powietrznej, jak i obiegowej.

    Jak Sensaka ujawnia gorące punkty w szafach GPU?

    Sensaka DCOS zbiera dane termiczne obudowy, stan wentylatorów i kondycję akceleratora w sposób bezagentowy przez interfejsy BMC, takie jak IPMI, Redfish, iDRAC, iLO i iBMC, i łączy je z danymi o mocy z PDU i UPS, czujnikami środowiskowymi oraz obsługiwaną telemetrią chłodzenia cieczą. Te odczyty są uporządkowane według obiektu, pomieszczenia, strefy chłodzenia, szafy i pozycji U, dzięki czemu nieprawidłowa obudowa jest pokazywana w kontekście otaczającej ją szafy i rzędu.

    Rozpocznij

    Zobacz szafę, zanim zrobi to średnia dla pomieszczenia

    Zbierz dane termiczne obudowy, moc szafy, czujniki środowiskowe i dane obiegu chłodzenia w jednym widoku.