Zum Inhalt springen
Schulung · KKC_0240

Linux Administration für KI-Workloads mit GPUs

Treiber, CUDA-Stack, Performance und stabile Deployments für Training und Inference im Betrieb

  • NVIDIA-Treiber versionieren
  • CUDA, cuDNN, NCCL koppeln
  • GPU-Container stabil betreiben
  • 3 Tage
  • Aufbau
  • Online
Linux Administration für KI-Workloads mit GPUs
  • Zufriedenheitsgarantie Risikofrei für dich
  • Online Live per Videokonferenz
  • max. 8 Teilnehmerinnen und Teilnehmer pro Gruppe
  • Keine Vorkasse Rechnung nach dem Seminar
Ergebnis

Das nimmst du mit

  • NVIDIA-Treiber versionieren
  • CUDA, cuDNN, NCCL koppeln
  • GPU-Container stabil betreiben
  • cgroups v2 und Limits anwenden
  • NUMA und Topologie einordnen
  • Monitoring und Runbooks aufbauen
Für wen

Passt das zu dir?

Damit du den Tag wirklich mitnimmst, lohnt sich ein kurzer Abgleich.

Richtig für dich, wenn

  • Linux-Administratorinnen und Linux-Administratoren mit Betriebsverantwortung für GPU-Server
  • DevOps- und Platform-Engineers für containerisierte KI-Workloads
  • ML-Engineers und MLOps-Verantwortliche mit Infrastruktur- und Deployment-Aufgaben
  • IT-Betrieb und SRE-Teams für stabile Training- und Inference-Umgebungen

Das bringst du mit

  • Sichere Linux-Kenntnisse in Shell, Systemdiensten, Paketmanagement und Logs
  • Administrationspraxis auf Server-Systemen, idealerweise auf Niveau des Linux Aufbaukurs: Administration und Systemmanagement
  • Grundverständnis von Containern und Docker, bei Bedarf auffrischbar im Docker Grundkurs
  • Erste Berührungspunkte mit KI-Workloads, MLOps oder GPU-basierten Anwendungen sind hilfreich
Ablauf

Dein Lernweg

  1. Tag 1: GPU-Stack, Treiber und CUDA-Kompatibilität

    Der erste Tag legt die Grundlage für stabile GPU-Server unter Linux. Behandelt werden Treiberstrategie, DKMS, Secure Boot, Kernel-Updates, Repository-Pinning und Validierung über nvidia-smi, Persistenced und Smoke-Tests.

    • NVIDIA-Treiber und Kernel-Integration
    • CUDA, cuDNN und NCCL-Kompatibilität
    • Multi-GPU-Topologie, PCIe, NVLink, NUMA
    • Typische Modul- und Library-Fehlerbilder
  2. Tag 2: Container, Ressourcensteuerung und Isolation

    Der zweite Tag konzentriert sich auf containerisierte KI-Workloads. Im Mittelpunkt stehen Docker, NVIDIA Container Toolkit, CDI, reproduzierbare Images, Berechtigungen und robuste Runtime-Konfigurationen für Training und Inference.

    • GPU-Zugriff in Containern
    • Base-Images, Pinning und SBOM-Idee
    • cgroups v2, Ulimits und Shared Memory
    • MIG, GPU-Slicing und Mehrbenutzerbetrieb
  3. Tag 3: Performance, Observability und Betriebsübergabe

    Der dritte Tag verbindet Performance-Tuning, Monitoring und Betriebssicherheit. Bearbeitet werden Storage- und Netzwerkpfade, NUMA-Optimierung, DCGM-basierte Metriken, Incident-Playbooks, Rollback-Strategien und die strukturierte Übergabe an den IT-Betrieb.

    • NVMe, RAID, Filesysteme und Dataset-Caching
    • MTU, RDMA-Grundlagen und Latenz-Checks
    • GPU-Utilization, Thermals und Power-Limits
    • Go-Live-Checkliste, Runbooks und Verantwortlichkeiten
So läuft es ab

Klarheit von Anfang an

Format, Ablauf und alles, was schon enthalten ist. Keine Überraschungen, nur Fokus auf dein Ergebnis.

Format
  • Live-OnlineInteraktiv per Videokonferenz, von überall
Dauer

3 Tage

Kompakt aufgebaut, damit du schnell ins Tun kommst.

Gruppengröße

max. 8

Kleine Gruppe, damit genug Raum für deine Fragen bleibt.

Methodik
  • Trainerinput mit Entscheidungsregeln und realen Betriebsbeispielen
  • Geführte Hands-on-Übungen in bereitgestellten Linux-Umgebungen mit GPU
  • Troubleshooting-Labs anhand realistischer Treiber-, CUDA- und Container-Fehlerbilder
  • Erarbeitung von Checklisten, Kompatibilitätsmatrix und Runbooks
  • Gemeinsame Auswertung typischer Betriebsentscheidungen für Training und Inference

Das ist immer dabei

  • Ausführliche Schulungsunterlagen und Praxisbeispiele
  • Teilnahmezertifikat
  • Übungsumgebungen und Beispieldaten
  • Nachbetreuung per E-Mail nach dem Seminar
04 Termine

Sichere dir deinen Platz

Wähle den Termin, der zu dir passt. Online live dabei oder vor Ort, ganz wie es für dich passt.

  • 16. November 2026 bis 18. November 2026 Live-Online
    Preis auf Anfrage
    Platz sichern
  • 01. Februar 2027 bis 03. Februar 2027 Live-Online
    Preis auf Anfrage
    Platz sichern
  • 05. April 2027 bis 07. April 2027 Live-Online
    Preis auf Anfrage
    Platz sichern
  • 14. Juni 2027 bis 16. Juni 2027 Live-Online
    Preis auf Anfrage
    Platz sichern
  • Erfahrene IT-Trainer aus der Praxis
  • Keine Vorkasse, Rechnung nach dem Seminar
  • Kostenfreie Umbuchung bis 14 Tage vor Start
Für Teams und Unternehmen

Lieber das ganze Team?

Bring dieses Seminar zu euch ins Haus oder lass uns ein Programm bauen, das genau auf euer Unternehmen passt.

Firmen-Seminar

Ein individuelles Programm, das wir auf eure Ziele zuschneiden.

  • Frei kombinierbare Module aus unserem Themenkatalog
  • Skalierbar von der Kleingruppe bis zur ganzen Belegschaft
  • Begleitung über mehrere Termine hinweg möglich
Persönlich für dich da

Deine IT-Schulungen München-Expertinnen und -Experten

Du hast Fragen zu Inhalten, Terminen oder einer passenden Lösung für dein Team? Wir beraten dich gern, bevor du buchst. Direkt, ohne Umwege.

Antwort in der Regel am selben Werktag

Dein cmt-Team München

Beratung zu IT-Weiterbildung

Fragen und Antworten zu Linux Administration für KI-Workloads mit GPUs

Brauche ich ein eigenes Notebook oder eigene Lizenzen?

Nein. Geräte, VMs und Software werden dir bei Bedarf zur Verfügung gestellt. Für die Übungen nutzt das Seminar vorbereitete Linux-Umgebungen mit GPU-Bezug.

Ist das Seminar eher für Training oder Inference gedacht?

Beides. Das Seminar behandelt gemeinsame Betriebsgrundlagen und die Unterschiede, die in produktiven Umgebungen relevant sind, etwa Image-Strategie, Ressourcenlimits, Shared Memory, Monitoring und Abnahmechecks.

Welche Linux-Distribution wird im Seminar verwendet?

Die Übungen sind so aufgebaut, dass die Konzepte auf gängige Enterprise- und Server-Distributionen übertragbar sind. Die konkrete Übungsumgebung wird im Seminar gestellt.

Wie tief geht das Seminar in Kubernetes?

Der Schwerpunkt liegt auf Linux, NVIDIA-Treiber-Stack, CUDA-Kompatibilität und Container-Runtime. Kubernetes wird dort angesprochen, wo es für GPU-Container-Prinzipien, Device-Zugriff und Troubleshooting hilfreich ist.

Welche Vorkenntnisse in Docker sind erforderlich?

Grundverständnis von Images, Containern und Volumes ist hilfreich. Wer vorab eine solide Basis benötigt, kann den Docker Grundkurs als Vorbereitung nutzen.

Geht es auch um Storage-Performance für KI-Datasets?

Ja. Storage-Pfade, NVMe, RAID, Filesystem-Optionen und Dataset-Caching werden im Zusammenhang mit Trainings- und Inference-Workloads behandelt. Eine fachliche Vertiefung bietet das Seminar Linux Storage und Dateisysteme.

Werden typische GPU-Fehler praktisch analysiert?

Ja. Das Seminar enthält Troubleshooting-Labs zu Treiber-, Kernel-, CUDA- und Runtime-Problemen. Für eine breitere Methodik zur Fehleranalyse passt ergänzend das Linux Troubleshooting Training.

Bereit?

Bring dein Team mit Linux Administration für KI-Workloads mit GPUs weiter

Wir beraten dich unverbindlich zur passenden Schulungsform: offenes Seminar, Inhouse oder individuell zugeschnitten.

Linux Administration für KI-Workloads mit GPUs

Nächster Termin: 16. November 2026 · Online

ab1.490 €netto