AI-Infrastruktur-CMDB und Impact-Analyse
Verbinden Sie jede Facility, GPU, jeden Workload, Service und Eigentümer.
Die Sensaka AI-Infrastruktur-CMDB ersetzt isolierte Asset-Listen durch ein lebendiges Beziehungsmodell für den Betrieb von AI-Rechenzentren. Sie verbindet physische Infrastruktur, Compute-Kapazität, Betriebsaktivität, Personen und Business Services, damit Teams verstehen, was ein Asset ist, wo es sich befindet, was es unterstützt, wem es gehört und was bei einem Ausfall betroffen sein könnte.
Eine statische Asset-Liste kann AI-Infrastruktur nicht erklären
Klassische Asset-Inventare erfassen Geräte, Seriennummern und Standorte. Der Betrieb von AI-Infrastruktur erfordert eine breitere und dynamischere Sicht.
Eine einzelne GPU kann Teil eines physischen Servers sein, einem Ressourcen-Pool zugewiesen, einem Container zugeteilt, von einem Trainings- oder Inferenz-Workload genutzt, einem Projekt zugeordnet und mit einem Service verbunden sein, den ein Fachbereich nutzt.
Werden diese Beziehungen in getrennten Tools gepflegt, fällt es Betreibern schwer, während eines Vorfalls grundlegende Fragen zu beantworten:
Sensaka schafft den Beziehungskontext, der nötig ist, um diese Fragen zu beantworten.
Die fünf Dimensionen des AI-Rechenzentrumsbetriebs modellieren
Die Sensaka CMDB organisiert AI-Infrastruktur um fünf miteinander verbundene Dimensionen.
Personen
Erfassen Sie verantwortliche Eigentümer, Betriebsteams, Mandanten, Lieferanten, Rollen und Berechtigungen. Verknüpfen Sie Infrastruktur und Services mit den dafür verantwortlichen Personen.
Physische Infrastruktur
Verwalten Sie Facilities, Räume, Racks, Rack-Einheiten, Server, Beschleunigerkarten, Netzwerke, Storage-Systeme, Stromversorgungsanlagen und Flüssigkeitskühlungsinfrastruktur.
Betriebsaktivität
Verbinden Sie Scheduling-Aktivitäten, Trainings- und Inferenz-Workloads, Alarme, Service-Tickets, Änderungen, Inspektionen und Wartungsprotokolle.
Compute-Kapazität
Modellieren Sie Cluster, Nodes, Ressourcen-Pools, Spezifikationen, Quoten, zugewiesene und verfügbare Kapazität.
Business Services
Verknüpfen Sie Modell-Services, Inferenz-Instanzen, Anwendungen, Agents, Projekte und Fachbereiche mit der Infrastruktur, die sie nutzen.
Gemeinsam ergeben diese fünf Dimensionen ein Betriebsmodell, das mehr leistet als ein reines Geräteinventar.
Infrastrukturdaten automatisch aktuell halten
AI-Infrastruktur verändert sich fortlaufend. Neue Geräte werden installiert, Beschleunigerkarten ausgetauscht, Workloads verschoben, Container neu gestartet und Ressourcenzuweisungen geändert.
Sensaka nutzt Infrastrukturerkennung und Konfigurationssynchronisation, um die Abhängigkeit von manuellen Aktualisierungen zu reduzieren. Unterstützte Geräte-, BMC-, Kubernetes- und Infrastruktur-Interfaces können aktuelle Konfigurations- und Beziehungsdaten liefern. Die Plattform kann Folgendes erfassen:
Regeln zur Datenhoheit und der Umgang mit Konflikten sollten während der Implementierung festgelegt werden, damit Teams wissen, welcher Quelle sie vertrauen, wenn automatische Erkennung und manuelle Einträge voneinander abweichen.
Physische und logische Beziehungen gemeinsam verwalten
AI-Infrastruktur umfasst sowohl physische als auch logische Abhängigkeitsketten.
Physische Beziehungen
Facility, Rack, Server, Slot, Beschleuniger, Netzwerk-Port, Storage-Verbindung, Strompfad und Kühlungsstandort.
Logische Beziehungen
Cluster, Ressourcen-Pool, Container, Workload, Modell-Service, Anwendung, Projekt und Eigentümer.
Sensaka führt diese Beziehungen in einem gemeinsamen Graphen zusammen, sodass Betreiber zwischen der physischen und der logischen Sicht auf denselben Service wechseln können. Ein Betreiber kann beispielsweise mit einem langsamen Inferenz-Service beginnen, dessen Instanz und Container lokalisieren, GPU und Node identifizieren, Netzwerk- und Storage-Abhängigkeiten prüfen und anschließend den physischen Server und den Hardwarezustand untersuchen.
Business-Impact verstehen, bevor Sie handeln
Meldet ein Beschleuniger, Node oder eine Infrastrukturkomponente ein Problem, kann Sensaka anhand des Beziehungsgraphen helfen, den wahrscheinlichen Umfang der Auswirkungen zu bestimmen.
Aufwärts blicken: zu Services und Business-Kontext
Identifizieren Sie betroffene Modell-Services, Inferenz-Instanzen, Anwendungen, Projekte und Fachbereiche. Sind Service-Zusagen erfasst, kann die Impact-Ansicht den relevanten Service-Level-Kontext einbeziehen.
Abwärts blicken: zu Infrastruktur-Nachweisen
Prüfen Sie Status von Beschleuniger, Node und Komponenten, und korrelieren Sie anschließend Netzwerk-, Storage-, Temperatur- und Hardwarezustandsdaten rund um das Ereignis.
Seitwärts blicken: zu Verantwortung und Workflow
Identifizieren Sie den verantwortlichen Eigentümer oder das Betriebsteam, und erstellen Sie ein Response-Ticket mit den betroffenen Objekten und dem Untersuchungskontext.
So entsteht ein klarerer Übergang von einem Infrastrukturalarm zu einer geschäftsbewussten operativen Reaktion.
Änderungen nachverfolgen und die Vergangenheit rekonstruieren
Konfigurationsänderungen können Performance-Probleme und Ausfälle erklären, aber nur, wenn die Historie verfügbar ist. Sensaka erfasst Änderungen mit altem und neuem Wert, dem Bearbeiter oder der Erkennungsquelle sowie dem Wirkzeitpunkt. Historische Snapshots helfen Teams, den Zustand eines Assets und seiner Beziehungen zu einem früheren Zeitpunkt zu rekonstruieren.
Wo die AI-Infrastruktur-CMDB ansetzt
Impact-Analyse bei GPU-Ausfällen
Beginnen Sie mit einem Beschleuniger-Alarm. Identifizieren Sie Node, Container, Workload, Modell-Service, Projekt und Eigentümer, die mit der betroffenen Karte verbunden sind. Prüfen Sie zugehörige Temperatur-, Strom-, ECC-, Netzwerk- und Storage-Informationen, bevor Sie die Reaktion zuweisen.
Untersuchung langsamer Inferenz-Services
Beginnen Sie mit dem betroffenen Service und arbeiten Sie sich abwärts durch Instanz, Container, GPU und physischen Node vor. Ermitteln Sie, ob die Serviceverschlechterung mit Ressourcen-, Hardware- oder Infrastrukturbedingungen zusammenhängt.
Abgleich von AI-Infrastruktur-Assets
Vergleichen Sie erkannte Server- und Beschleunigerkonfigurationen mit dem CMDB-Datensatz. Identifizieren Sie fehlende Assets, Konfigurationsänderungen oder Standortabweichungen.
Änderungs- und Audit-Prüfung
Prüfen Sie, wer ein Asset oder eine Beziehung geändert hat, wann die Änderung erfolgte und wie sie entdeckt wurde. Rekonstruieren Sie den Konfigurationsstand zum Zeitpunkt eines Vorfalls.
Verantwortlichkeits-Mapping
Verknüpfen Sie Cluster, Ressourcen-Pools, Projekte und Services mit Eigentümern und Betriebsteams, damit Vorfälle weitergeleitet werden können, ohne separate Kontaktlisten durchsuchen zu müssen.
Übergabe von Delivery an den Betrieb
Nachdem ein Server bereitgestellt wurde, registrieren Sie ihn in der CMDB, nehmen ihn ins Monitoring auf und verbinden ihn mit den richtigen Facility-, Cluster- und Ressourcenbeziehungen.
Alles, was das Beziehungsmodell braucht
Integrierte, tiefgehende Transparenz der physischen Infrastruktur
Sensaka verbindet CMDB-Funktionen mit tiefgehender Transparenz der physischen Infrastruktur. Die Plattform kann Geräte-Management-Interfaces, BMC-Daten, Beschleuniger-Telemetrie, Kubernetes-Informationen, Netzwerkdaten und Betriebsprotokolle nutzen, um das Modell mit der laufenden Umgebung verbunden zu halten.
Das ist in AI-Rechenzentren besonders wichtig, da sich die Abhängigkeitskette über Facilities, Hardware, Software-Plattformen und Business Services erstreckt. Ein Beziehungsmodell, das nur auf Cloud- oder Anwendungsdaten basiert, kann den physischen Komponenten-, Strom-, Kühlungs- und Standortkontext übersehen, der für eine vollständige Impact-Analyse nötig ist.
Eine nützliche CMDB hängt ebenso von Governance wie von Technologie ab
Während der Implementierung sollten Sensaka und der Kunde Folgendes festlegen:
Häufig gestellte Fragen
Was unterscheidet eine AI-Infrastruktur-CMDB von einer klassischen CMDB?
Sie umfasst Beschleunigerkarten, Cluster, Ressourcen-Pools, Container, AI-Workloads, Modell-Services und deren Beziehungen zur physischen Rechenzentrumsinfrastruktur. Sie muss sowohl sich schnell ändernde logische Zuweisungen als auch langlebige physische Assets abbilden.
Kann Sensaka GPUs automatisch erkennen?
Sensaka kann Beschleuniger-Inventar und Node-Beziehungen von unterstützten Hardware- und Software-Interfaces erfassen. Die genauen Felder und die Aktualisierungshäufigkeit hängen von den verfügbaren Herstellern und Management-Interfaces ab.
Ersetzt die CMDB unsere bestehende Enterprise-CMDB?
Sie kann als Datengrundlage für die AI-Infrastruktur dienen oder in eine bestehende Enterprise-CMDB integriert werden. Die richtige Architektur hängt von Datenhoheit, Systemgrenzen und den aktuellen Prozessen des Kunden ab.
Kann die Plattform anzeigen, welcher Business Service von einem GPU-Ausfall betroffen ist?
Ja, sofern die erforderlichen Beziehungen von GPU über Node, Workload und Modell-Service bis zu Projekt und Business Service vollständig sind. Die Qualität der Impact-Analyse hängt von der Vollständigkeit und Genauigkeit dieser Beziehungen ab.
Können wir historische Konfigurationen einsehen?
Sensaka unterstützt Änderungshistorie und die Rekonstruktion von Snapshots zu bestimmten Zeitpunkten für verwaltete Konfigurationsdaten. Aufbewahrungsdauer und Detailgrad sollten während der Implementierung festgelegt werden.
Kann eine Impact-Analyse ein ITSM-Ticket erstellen?
Sensaka kann das verantwortliche Team zuordnen und über den verfügbaren Workflow oder die ITSM-Integration ein Service-Ticket auslösen. Das genaue Routing und der Freigabeprozess werden für die Kundenumgebung konfiguriert.
Infrastrukturdaten in operativen Kontext verwandeln
Wissen Sie, was jedes Asset unterstützt, wem es gehört und was betroffen sein wird, bevor die nächste Maßnahme ergriffen wird.
Weitere Themen: AI-Infrastruktur-Observability, GPU-Nutzungsmessung, Flüssigkeitskühlungs-Monitoring
