Sensaka AI-Rechenzentrums-Betriebsmanagement-Plattform

    AI-Infrastruktur-CMDB und Impact-Analyse

    Verbinden Sie jede Facility, GPU, jeden Workload, Service und Eigentümer.

    Die Sensaka AI-Infrastruktur-CMDB ersetzt isolierte Asset-Listen durch ein lebendiges Beziehungsmodell für den Betrieb von AI-Rechenzentren. Sie verbindet physische Infrastruktur, Compute-Kapazität, Betriebsaktivität, Personen und Business Services, damit Teams verstehen, was ein Asset ist, wo es sich befindet, was es unterstützt, wem es gehört und was bei einem Ausfall betroffen sein könnte.

    Das Problem

    Eine statische Asset-Liste kann AI-Infrastruktur nicht erklären

    Klassische Asset-Inventare erfassen Geräte, Seriennummern und Standorte. Der Betrieb von AI-Infrastruktur erfordert eine breitere und dynamischere Sicht.

    Eine einzelne GPU kann Teil eines physischen Servers sein, einem Ressourcen-Pool zugewiesen, einem Container zugeteilt, von einem Trainings- oder Inferenz-Workload genutzt, einem Projekt zugeordnet und mit einem Service verbunden sein, den ein Fachbereich nutzt.

    Werden diese Beziehungen in getrennten Tools gepflegt, fällt es Betreibern schwer, während eines Vorfalls grundlegende Fragen zu beantworten:

    Welcher Workload nutzt diese GPU?
    Welcher Modell-Service läuft auf diesem Node?
    Welches Projekt und welche Abteilung sind betroffen?
    Wem gehört der Service, und wer sollte reagieren?
    Was hat sich geändert, bevor das Problem auftrat?

    Sensaka schafft den Beziehungskontext, der nötig ist, um diese Fragen zu beantworten.

    Datenmodell

    Die fünf Dimensionen des AI-Rechenzentrumsbetriebs modellieren

    Die Sensaka CMDB organisiert AI-Infrastruktur um fünf miteinander verbundene Dimensionen.

    Personen

    Erfassen Sie verantwortliche Eigentümer, Betriebsteams, Mandanten, Lieferanten, Rollen und Berechtigungen. Verknüpfen Sie Infrastruktur und Services mit den dafür verantwortlichen Personen.

    Physische Infrastruktur

    Verwalten Sie Facilities, Räume, Racks, Rack-Einheiten, Server, Beschleunigerkarten, Netzwerke, Storage-Systeme, Stromversorgungsanlagen und Flüssigkeitskühlungsinfrastruktur.

    Betriebsaktivität

    Verbinden Sie Scheduling-Aktivitäten, Trainings- und Inferenz-Workloads, Alarme, Service-Tickets, Änderungen, Inspektionen und Wartungsprotokolle.

    Compute-Kapazität

    Modellieren Sie Cluster, Nodes, Ressourcen-Pools, Spezifikationen, Quoten, zugewiesene und verfügbare Kapazität.

    Business Services

    Verknüpfen Sie Modell-Services, Inferenz-Instanzen, Anwendungen, Agents, Projekte und Fachbereiche mit der Infrastruktur, die sie nutzen.

    Gemeinsam ergeben diese fünf Dimensionen ein Betriebsmodell, das mehr leistet als ein reines Geräteinventar.

    Datenaktualität

    Infrastrukturdaten automatisch aktuell halten

    AI-Infrastruktur verändert sich fortlaufend. Neue Geräte werden installiert, Beschleunigerkarten ausgetauscht, Workloads verschoben, Container neu gestartet und Ressourcenzuweisungen geändert.

    Sensaka nutzt Infrastrukturerkennung und Konfigurationssynchronisation, um die Abhängigkeit von manuellen Aktualisierungen zu reduzieren. Unterstützte Geräte-, BMC-, Kubernetes- und Infrastruktur-Interfaces können aktuelle Konfigurations- und Beziehungsdaten liefern. Die Plattform kann Folgendes erfassen:

    Geräte- und Komponenteninventar
    GPU- und NPU-Modell, Anzahl und Node-Standort
    Standort von Facility, Rack und Rack-Einheit
    Zugehörigkeit zu Cluster, Node und Ressourcen-Pool
    Zuweisung von Workload, Container und Beschleuniger
    Zuordnung von Projekt, Mandant und Eigentümer
    Konfigurationsänderungen und Betriebshistorie

    Regeln zur Datenhoheit und der Umgang mit Konflikten sollten während der Implementierung festgelegt werden, damit Teams wissen, welcher Quelle sie vertrauen, wenn automatische Erkennung und manuelle Einträge voneinander abweichen.

    Beziehungsgraph

    Physische und logische Beziehungen gemeinsam verwalten

    AI-Infrastruktur umfasst sowohl physische als auch logische Abhängigkeitsketten.

    Physische Beziehungen

    Facility, Rack, Server, Slot, Beschleuniger, Netzwerk-Port, Storage-Verbindung, Strompfad und Kühlungsstandort.

    Logische Beziehungen

    Cluster, Ressourcen-Pool, Container, Workload, Modell-Service, Anwendung, Projekt und Eigentümer.

    Sensaka führt diese Beziehungen in einem gemeinsamen Graphen zusammen, sodass Betreiber zwischen der physischen und der logischen Sicht auf denselben Service wechseln können. Ein Betreiber kann beispielsweise mit einem langsamen Inferenz-Service beginnen, dessen Instanz und Container lokalisieren, GPU und Node identifizieren, Netzwerk- und Storage-Abhängigkeiten prüfen und anschließend den physischen Server und den Hardwarezustand untersuchen.

    Impact-Analyse

    Business-Impact verstehen, bevor Sie handeln

    Meldet ein Beschleuniger, Node oder eine Infrastrukturkomponente ein Problem, kann Sensaka anhand des Beziehungsgraphen helfen, den wahrscheinlichen Umfang der Auswirkungen zu bestimmen.

    Aufwärts blicken: zu Services und Business-Kontext

    Identifizieren Sie betroffene Modell-Services, Inferenz-Instanzen, Anwendungen, Projekte und Fachbereiche. Sind Service-Zusagen erfasst, kann die Impact-Ansicht den relevanten Service-Level-Kontext einbeziehen.

    Abwärts blicken: zu Infrastruktur-Nachweisen

    Prüfen Sie Status von Beschleuniger, Node und Komponenten, und korrelieren Sie anschließend Netzwerk-, Storage-, Temperatur- und Hardwarezustandsdaten rund um das Ereignis.

    Seitwärts blicken: zu Verantwortung und Workflow

    Identifizieren Sie den verantwortlichen Eigentümer oder das Betriebsteam, und erstellen Sie ein Response-Ticket mit den betroffenen Objekten und dem Untersuchungskontext.

    So entsteht ein klarerer Übergang von einem Infrastrukturalarm zu einer geschäftsbewussten operativen Reaktion.

    Änderungshistorie

    Änderungen nachverfolgen und die Vergangenheit rekonstruieren

    Konfigurationsänderungen können Performance-Probleme und Ausfälle erklären, aber nur, wenn die Historie verfügbar ist. Sensaka erfasst Änderungen mit altem und neuem Wert, dem Bearbeiter oder der Erkennungsquelle sowie dem Wirkzeitpunkt. Historische Snapshots helfen Teams, den Zustand eines Assets und seiner Beziehungen zu einem früheren Zeitpunkt zu rekonstruieren.

    Vorfalluntersuchung Analyse von Konfigurationsabweichungen Audit- und Compliance-Prüfung Änderungsvalidierung Kapazitäts- und Lifecycle-Planung Vergleich des Infrastrukturzustands vor und nach einem Ereignis
    Typische Anwendungsfälle

    Wo die AI-Infrastruktur-CMDB ansetzt

    Impact-Analyse bei GPU-Ausfällen

    Beginnen Sie mit einem Beschleuniger-Alarm. Identifizieren Sie Node, Container, Workload, Modell-Service, Projekt und Eigentümer, die mit der betroffenen Karte verbunden sind. Prüfen Sie zugehörige Temperatur-, Strom-, ECC-, Netzwerk- und Storage-Informationen, bevor Sie die Reaktion zuweisen.

    Untersuchung langsamer Inferenz-Services

    Beginnen Sie mit dem betroffenen Service und arbeiten Sie sich abwärts durch Instanz, Container, GPU und physischen Node vor. Ermitteln Sie, ob die Serviceverschlechterung mit Ressourcen-, Hardware- oder Infrastrukturbedingungen zusammenhängt.

    Abgleich von AI-Infrastruktur-Assets

    Vergleichen Sie erkannte Server- und Beschleunigerkonfigurationen mit dem CMDB-Datensatz. Identifizieren Sie fehlende Assets, Konfigurationsänderungen oder Standortabweichungen.

    Änderungs- und Audit-Prüfung

    Prüfen Sie, wer ein Asset oder eine Beziehung geändert hat, wann die Änderung erfolgte und wie sie entdeckt wurde. Rekonstruieren Sie den Konfigurationsstand zum Zeitpunkt eines Vorfalls.

    Verantwortlichkeits-Mapping

    Verknüpfen Sie Cluster, Ressourcen-Pools, Projekte und Services mit Eigentümern und Betriebsteams, damit Vorfälle weitergeleitet werden können, ohne separate Kontaktlisten durchsuchen zu müssen.

    Übergabe von Delivery an den Betrieb

    Nachdem ein Server bereitgestellt wurde, registrieren Sie ihn in der CMDB, nehmen ihn ins Monitoring auf und verbinden ihn mit den richtigen Facility-, Cluster- und Ressourcenbeziehungen.

    Wichtigste Funktionen

    Alles, was das Beziehungsmodell braucht

    Modellierung von Personen, physischer Infrastruktur, Aktivität, Compute und Business
    Automatische Erkennung und Konfigurationssynchronisation
    GPU- und NPU-Inventar auf Komponentenebene
    Verwaltung von Facility, Rack und Rack-Einheit
    Graph physischer und logischer Beziehungen
    Mapping von Workload, Container, GPU und Node
    Zuordnung von Projekt, Mandant, Service und Eigentümer
    Änderungshistorie und Rekonstruktion historischer Snapshots
    Aufwärtsgerichtete Service- und Business-Impact-Analyse
    Abwärtsgerichtete Infrastruktur- und Hardware-Untersuchung
    Verantwortlichkeits-Mapping und Erstellung von Service-Tickets
    Integration mit Monitoring, Scheduling, Verbrauchsmessung und Betriebs-Workflows je nach Projektumfang
    Warum Sensaka

    Integrierte, tiefgehende Transparenz der physischen Infrastruktur

    Sensaka verbindet CMDB-Funktionen mit tiefgehender Transparenz der physischen Infrastruktur. Die Plattform kann Geräte-Management-Interfaces, BMC-Daten, Beschleuniger-Telemetrie, Kubernetes-Informationen, Netzwerkdaten und Betriebsprotokolle nutzen, um das Modell mit der laufenden Umgebung verbunden zu halten.

    Das ist in AI-Rechenzentren besonders wichtig, da sich die Abhängigkeitskette über Facilities, Hardware, Software-Plattformen und Business Services erstreckt. Ein Beziehungsmodell, das nur auf Cloud- oder Anwendungsdaten basiert, kann den physischen Komponenten-, Strom-, Kühlungs- und Standortkontext übersehen, der für eine vollständige Impact-Analyse nötig ist.

    Implementierungsprinzipien

    Eine nützliche CMDB hängt ebenso von Governance wie von Technologie ab

    Während der Implementierung sollten Sensaka und der Kunde Folgendes festlegen:

    01Konfigurationselement-Typen und erforderliche Attribute
    02Eindeutige Kennungen für Facilities, Geräte, Komponenten und Services
    03Vertrauenswürdige Datenquellen und Regeln zur Konfliktlösung
    04Felder für Eigentümerschaft und Verantwortung
    05Regeln zur Erkennung und Pflege von Beziehungen
    06Anforderungen an Aufbewahrung von Änderungen und Audits
    07Kennzeichnungen für Service-Level und Business-Impact
    08Integrationsgrenzen zu bestehenden CMDB-, ITSM- und Monitoring-Systemen
    FAQ

    Häufig gestellte Fragen

    Was unterscheidet eine AI-Infrastruktur-CMDB von einer klassischen CMDB?

    Sie umfasst Beschleunigerkarten, Cluster, Ressourcen-Pools, Container, AI-Workloads, Modell-Services und deren Beziehungen zur physischen Rechenzentrumsinfrastruktur. Sie muss sowohl sich schnell ändernde logische Zuweisungen als auch langlebige physische Assets abbilden.

    Kann Sensaka GPUs automatisch erkennen?

    Sensaka kann Beschleuniger-Inventar und Node-Beziehungen von unterstützten Hardware- und Software-Interfaces erfassen. Die genauen Felder und die Aktualisierungshäufigkeit hängen von den verfügbaren Herstellern und Management-Interfaces ab.

    Ersetzt die CMDB unsere bestehende Enterprise-CMDB?

    Sie kann als Datengrundlage für die AI-Infrastruktur dienen oder in eine bestehende Enterprise-CMDB integriert werden. Die richtige Architektur hängt von Datenhoheit, Systemgrenzen und den aktuellen Prozessen des Kunden ab.

    Kann die Plattform anzeigen, welcher Business Service von einem GPU-Ausfall betroffen ist?

    Ja, sofern die erforderlichen Beziehungen von GPU über Node, Workload und Modell-Service bis zu Projekt und Business Service vollständig sind. Die Qualität der Impact-Analyse hängt von der Vollständigkeit und Genauigkeit dieser Beziehungen ab.

    Können wir historische Konfigurationen einsehen?

    Sensaka unterstützt Änderungshistorie und die Rekonstruktion von Snapshots zu bestimmten Zeitpunkten für verwaltete Konfigurationsdaten. Aufbewahrungsdauer und Detailgrad sollten während der Implementierung festgelegt werden.

    Kann eine Impact-Analyse ein ITSM-Ticket erstellen?

    Sensaka kann das verantwortliche Team zuordnen und über den verfügbaren Workflow oder die ITSM-Integration ein Service-Ticket auslösen. Das genaue Routing und der Freigabeprozess werden für die Kundenumgebung konfiguriert.

    Jetzt starten

    Infrastrukturdaten in operativen Kontext verwandeln

    Wissen Sie, was jedes Asset unterstützt, wem es gehört und was betroffen sein wird, bevor die nächste Maßnahme ergriffen wird.

    Weitere Themen: AI-Infrastruktur-Observability, GPU-Nutzungsmessung, Flüssigkeitskühlungs-Monitoring