Thermische Hotspots in GPU-Racks erkennen
Ein thermischer Hotspot ist ein lokaler Bereich, in dem die Wärmeproduktion die zugeführte Luft oder das Kühlmittel übersteigt. In einem konventionellen Rack ist der Raumdurchschnitt meist ein brauchbarer Näherungswert für das, was jeder Server erlebt. In einem GPU-Rack ist das nicht so: Die Wärme konzentriert sich auf wenige Rack-Einheiten, sie trifft in Schüben ein, wenn Jobs starten, und ein einzelnes Chassis kann in Schwierigkeiten sein, während der Raum normale Werte zeigt. Erkennung hängt davon ab, die richtigen Signale miteinander zu vergleichen, statt eine einzelne Zahl gegen eine Linie zu beobachten.
Warum dichte GPU-Racks Hotspots entwickeln
AI-Racks arbeiten mit Leistungsdichten, auf die ältere Räume nicht ausgelegt waren. Die Folgen sind physisch und lokal begrenzt, weshalb sie Dashboards auf Raumebene entgehen.
Leistungsdichte konzentriert auf wenige Rack-Einheiten
Ein Beschleuniger-Chassis kann auf 8U mehr Leistung ziehen, als ein konventionelles Rack auf 42U gezogen hat. Die Wärme entsteht auf kleinem Raum, weshalb der Spielraum zwischen normalem und grenzwertigem Luftstrom schmal ist.
Luftstrom, der für ein anderes Rack ausgelegt wurde
Containment, Bodenplatten, Blindplatten und die Platzierung der CRAC-Einheiten sind meist auf eine durchschnittliche kW-Zahl pro Rack ausgelegt. Setzt man ein dichtes GPU-Chassis in dieses Layout, bekommt es nicht immer die Luft, die es braucht.
Synchronisierte Last im gesamten Cluster
Verteiltes Training treibt jeden Knoten eines Jobs zum gleichen Zeitpunkt auf eine ähnliche Auslastung. Die thermische Last trifft als sprunghafte Änderung über eine ganze Reihe ein, statt als verstreute Spitzen.
Gemischte Kühlung im selben Raum
Direct-to-Chip-Flüssigkeitskreisläufe führen die Wärme der Beschleuniger ab, doch Netzteile, Speicher und Netzwerkkarten sind oft weiterhin luftgekühlt. Ein Rack kann bei der Kühlmitteltemperatur unauffällig wirken und trotzdem im Gang heiß sein.
Die Telemetrie, die einen Hotspot aufdeckt
Kein einzelner Messwert identifiziert einen Hotspot. Fünf Quellen, gemeinsam und zeitlich abgeglichen gelesen, tun es.
Zu- und Ablufttemperatur
Die Differenz zwischen Zu- und Abluft an jedem Chassis ist das erste verwertbare Signal. Ein steigendes Delta bei stabiler Zulufttemperatur bedeutet meist, dass die Geräte stärker arbeiten; eine steigende Zulufttemperatur zeigt, dass der Raum, das Containment oder eine Kühleinheit das Problem ist – nicht der Server.
BMC-Temperatursensoren
Der Baseboard Management Controller stellt Board-, CPU-, Speicher- und Beschleunigertemperaturen, Lüfterdrehzahlen, Lüfterfehler und den Throttling-Status bereit. Da er Out-of-Band ausgelesen wird, treffen die Daten weiterhin ein, wenn das Betriebssystem hängt oder der Knoten aus dem Scheduler herausgefallen ist.
Stromaufnahme pro Rack
PDU- und Stromkreis-Messwerte zeigen, wo die Wärme tatsächlich entsteht. Ein Rack, das nahe an seinem Stromkreislimit zieht, erzeugt nahezu seine maximale thermische Last – und genau dort entstehen Hotspots zuerst.
Temperaturen des Flüssigkeitskühlkreislaufs
Kühlmittel-Vorlauf- und -Rücklauftemperaturen, Differenzdruck und verfügbarer Durchfluss der CDU zeigen, ob der Kreislauf abführt, was die Racks hineingeben. Eine steigende Rücklauftemperatur bei stabilem Vorlauf deutet auf Last hin; steigen beide, deutet das auf den Kreislauf selbst hin.
Umgebungssensoren für Raum und Zone
Temperatur- und Feuchtigkeitssensoren im Gang liefern den Kontext, den ein einzelner Chassis-Messwert nicht liefern kann: ob eine einzelne Maschine auffällig ist oder sich die ganze Reihe verschoben hat.
Wie man die Signale liest
Vergleichen statt Schwellenwerte setzen
Ein fester Temperaturalarm löst spät aus und dann überall gleichzeitig. Der Vergleich jedes Chassis mit seinen Nachbarn im selben Rack und jedes Racks mit den anderen in der Reihe macht Ausreißer sichtbar, lange bevor ein absoluter Grenzwert erreicht wird.
Temperatur und Strom auf derselben Zeitachse betrachten
Temperatur allein kann einen Kühlfehler nicht von einer Workload-Änderung unterscheiden. Im Abgleich mit Rack-Stromaufnahme und Beschleuniger-Auslastung beantwortet die Reihenfolge meist die Frage: zuerst Strom, dann Wärme bedeutet Last; zuerst Wärme ohne Stromänderung bedeutet Luftstrom oder Kühlmittel.
Nicht nur Grad beobachten, sondern auch Throttling und Lüfterverhalten
Lüfter, die dauerhaft auf Maximum laufen, und Beschleuniger, die thermisches Throttling melden, sind die Hardware, die Ihnen sagt, dass sie bereits gegensteuert. Beides tritt auf, bevor der Temperaturwert alarmierend aussieht.
Bis zu Standort und Verantwortlichem auflösen
Ein Hotspot ist erst dann umsetzbar, wenn er einem Rack, einer U-Position, einer Kühlzone und dem zuständigen Team zugeordnet ist, zusammen mit den betroffenen Jobs und Services.
Wie Sensaka DCOS thermische Risiken im Rack sichtbar macht
DCOS erfasst Chassis-Temperaturdaten agentenlos vom Baseboard Management Controller über IPMI, Redfish, iDRAC, iLO und iBMC – herstellerübergreifend bei Servern und GPU-Chassis. Board-, CPU-, Speicher- und Beschleunigertemperaturen treffen zusammen mit Lüfterdrehzahl, Lüfterfehlerstatus, PSU-Last und Throttling-Indikatoren ein und treffen weiterhin ein, wenn das Betriebssystem nicht mehr reagiert. Das ist der Unterschied zwischen dem Wissen, dass ein Knoten heiß gelaufen ist, und dem Rätselraten, warum er verschwunden ist.
Diese Messwerte werden neben PDU-, Stromkreis- und USV-Daten für dasselbe Rack, Umgebungssensoren für Raum und Gang sowie, wo die Ausrüstung es bereitstellt, CDU-Status mit Kühlmittel-Vorlauf- und -Rücklauftemperatur, Differenzdruck und Durchflussindikatoren gestellt. Jede Messung wird einer Facility, einem Raum, einer Kühlzone, einem Rack und einer U-Position zugeordnet, sodass ein auffälliges Chassis gegen seine Nachbarn gelesen wird – nicht gegen einen Raumdurchschnitt.
Der operative Nutzen liegt im Überblick. Tritt ein Hotspot auf, kann die Plattform zeigen, welche Racks sich die Kühlzone teilen, welche Geräte in den betroffenen Einheiten stecken, welche Beschleuniger drosseln und welche Workloads von ihnen abhängen, sodass die Reaktion priorisiert statt von Grund auf untersucht werden kann. Verwandte Funktionsseiten: GPU-Infrastruktur-Monitoring für die Chassis-Ebene und Monitoring der Flüssigkeitskühlung für Kreislauf- und Facility-Ebene.
Maßgebliche Quellen
Häufige Fragen zu Hotspots in GPU-Racks
Was verursacht thermische Hotspots in GPU-Racks?
Hotspots entstehen dort, wo die Wärmeproduktion die zugeführte Luft oder das Kühlmittel übersteigt. In GPU-Racks sind die häufigen Ursachen: Leistungsdichte, die sich auf wenige Rack-Einheiten konzentriert, Luftstrom und Containment, die auf eine niedrigere durchschnittliche kW-Zahl pro Rack ausgelegt sind, synchronisierte Last über Knoten eines verteilten Trainingsjobs hinweg, blockierte oder ausgefallene Lüfter sowie gemischte Kühlung, bei der Beschleuniger flüssigkeitsgekühlt sind, während andere Komponenten weiterhin auf Luft angewiesen sind.
Welche Telemetrie zeigt einen Hotspot, bevor er einen Ausfall verursacht?
Zu- und Ablufttemperatur pro Chassis, BMC-Temperatursensoren einschließlich Board-, CPU-, Speicher- und Beschleuniger-Messwerten, Lüfterdrehzahl und Lüfterfehlerstatus, Throttling-Kennzeichnungen, Stromaufnahme pro Rack aus PDUs und Stromkreisen sowie in flüssigkeitsgekühlten Reihen Kühlmittel-Vorlauf- und -Rücklauftemperatur mit Differenzdruck und Durchflussindikatoren.
Warum ist Out-of-Band-Monitoring für die Temperaturerkennung wichtig?
Agentenbasierte Tools sind auf ein funktionierendes Betriebssystem angewiesen. Ein Knoten, der überhitzt, stark drosselt oder hängt, hört oft genau in dem Moment auf zu melden, in dem die Temperaturdaten am wichtigsten sind. Das Auslesen des Baseboard Management Controllers über IPMI oder Redfish hält den Sensor-Feed unabhängig vom Betriebssystem am Leben.
Wie unterscheidet man ein Kühlungsproblem von einem Workload-Problem?
Betrachten Sie die Reihenfolge der Ereignisse. Steigt zuerst die Stromaufnahme des Racks und folgt die Temperatur, hat sich die Workload geändert. Steigt die Temperatur, während der Strom konstant bleibt, wird die Wärme nicht abgeführt, was auf Luftstrom, einen Lüfter, eine Containment-Lücke oder den Kühlkreislauf hindeutet. Die Zulufttemperatur unterscheidet beides weiter: Eine steigende Zulufttemperatur ist ein Raum- oder Kühleinheiten-Zustand, kein Server-Zustand.
Löst Flüssigkeitskühlung das Hotspot-Problem?
Sie verändert es. Direct-to-Chip-Kreisläufe bewältigen die Wärme der Beschleuniger, doch Netzteile, Speicher und Netzwerkkomponenten im selben Chassis sind oft weiterhin luftgekühlt, und der Kreislauf selbst wird zu etwas, das überwacht werden muss: Vorlauf- und Rücklauftemperatur, Differenzdruck, verfügbarer Durchfluss und Leckage-Ereignisse. Teams mit gemischter Kühlung benötigen sowohl das Luft- als auch das Kreislaufbild.
Wie macht Sensaka Hotspots in GPU-Racks sichtbar?
Sensaka DCOS erfasst Chassis-Temperaturen, Lüfterstatus und Beschleuniger-Zustand agentenlos über BMC-Schnittstellen wie IPMI, Redfish, iDRAC, iLO und iBMC und kombiniert sie mit PDU- und USV-Stromdaten, Umgebungssensoren und unterstützter Flüssigkeitskühlungs-Telemetrie. Diese Messwerte werden nach Facility, Raum, Kühlzone, Rack und U-Position organisiert, sodass ein auffälliges Chassis im Kontext des umgebenden Racks und der Reihe angezeigt wird.
