Kubernetes Platform Engineer für AI/ML-Infrastruktur
🏛 Ausgeschrieben von Halian GmbHWir suchen einen erfahrenen Kubernetes Platform Engineer zur Leitung und Optimierung unserer Enterprise-Kubernetes-Umgebungen. In dieser Rolle werden Sie für die Deployment, Administration und kontinuierliche Verbesserung unserer containerisierten Infrastruktur verantwortlich sein.
Ihre Hauptaufgaben umfassen die Gestaltung und Implementierung von Infrastrukturlösungen für fortgeschrittene AI- und Machine-Learning-Workloads, einschließlich GPU-beschleunigter Umgebungen und großskaliger Datenverarbeitungspipelines. Sie werden automatisierte Infrastruktur-Provisioning-Prozesse mit modernen Tools wie Terraform, Ansible und Helm entwickeln und CI/CD-Pipelines für die Bereitstellung von AI-Services und containerisierten Anwendungen etablieren.
Ein weiterer Schwerpunkt liegt auf der Steigerung der operativen Reife durch Implementierung von Monitoring-, Logging- und Alerting-Lösungen sowie der Sicherung von Enterprise-Compliance-Standards. Sie optimieren kontinuierlich die Cluster-Performance, Storage-Nutzung und Ressourcenallokation und arbeiten eng mit AI-Engineers und Development-Teams zusammen.
Wir erwarten mindestens 5 Jahre Erfahrung in DevOps oder Platform Engineering mit mindestens 3 Jahren produktiver Kubernetes-Administration. Fundierte Kenntnisse in Infrastructure-as-Code, GPU-Kubernetes-Umgebungen und AI/ML-Plattformen sind erforderlich. Erfahrung mit CI/CD-Tools, Observability-Lösungen und Cloud-Native-Technologien runden das Profil ab.
Ein Bachelor-Abschluss in Informatik oder verwandten Disziplinen bzw. gleichwertige praktische Erfahrung wird vorausgesetzt. Relevante Zertifikationen sind von Vorteil.
Skills erklärt
- Kubernetes
- Open-Source-Plattform zur automatisierten Verwaltung, Skalierung und Orchestrierung von containerisierten Anwendungen.
- Nutanix
- Softwareplattform für hyperkonvergente Infrastruktur, die Speicher, Rechenleistung und Virtualisierung in einem System kombiniert.
- DevOps
- Kombination von Entwicklung und Betrieb, die Automatisierung, kontinuierliche Integration und schnellere Bereitstellung von Software ermöglicht.
- Platform Engineering
- Disziplin zur Entwicklung und Verwaltung von Infrastruktur-Plattformen, die Entwicklungsteams unterstützen.
- Terraform
- Infrastructure-as-Code-Tool zur automatisierten Bereitstellung und Verwaltung von Cloud-Infrastruktur über Konfigurationsdateien.
- Ansible
- Automatisierungs-Tool zur Verwaltung, Konfiguration und Bereitstellung von IT-Infrastruktur und Servern ohne Installation von Agenten.
- Helm
- Paketmanager für Kubernetes, der vordefinierte Anwendungskonfigurationen (Charts) bereitstellt und deren Deployment vereinfacht.
- GitOps
- Methode zur Infrastruktur- und Anwendungsverwaltung, bei der Git als zentrale Quelle für Konfigurationen und Deployments dient.
- CI/CD
- Automatisierte Prozesse für kontinuierliche Integration von Code-Änderungen und kontinuierliche Bereitstellung von Software-Updates.
- GitLab CI
- GitLab CI ist ein Continuous-Integration-System von GitLab, das automatisiert Code-Tests, Builds und Deployments durchführt, wenn Code in ein Repository gepusht wird.
- GitHub Actions
- Automatisierungstool von GitHub, das es ermöglicht, Workflows wie Tests, Builds oder Deployments automatisch bei bestimmten Ereignissen im Code-Repository auszulösen.
- Jenkins
- Automatisierungstool für kontinuierliche Integration und Deployment (CI/CD), das Softwareprojekte automatisch testet und bereitstellt.
- Prometheus
- Open-Source-Monitoring- und Alerting-System für IT-Infrastrukturen; wird zur Überwachung von Servern, Anwendungen und Metriken verwendet.
- Grafana
- Visualisierungs- und Monitoring-Tool, das Metriken und Logs aus verschiedenen Datenquellen grafisch darstellt und zur Überwachung von Systemen eingesetzt wird.
- ELK Stack
- Softwarestack bestehend aus Elasticsearch, Logstash und Kibana zur Erfassung, Verarbeitung und Visualisierung von großen Datenmengen und Logs.
- OpenTelemetry
- Open-Source-Standard zur Erfassung von Telemetriedaten (Logs, Metriken, Traces) aus Anwendungen für Monitoring und Debugging.
- RBAC
- Role-Based Access Control – Zugriffskontrollsystem, das Berechtigungen basierend auf Benutzerrollen verwaltet.
- Secrets Management
- Verwaltung und Schutz von sensiblen Daten wie Passwörtern, API-Schlüsseln und Zertifikaten in IT-Systemen.
- Python
- Universelle Programmiersprache für Webentwicklung, Datenanalyse, Automatisierung und künstliche Intelligenz.
- Bash
- Bash ist eine Kommandozeilen-Shell und Skriptsprache für Unix/Linux-Systeme; sie wird verwendet, um Befehle auszuführen und Automatisierungsaufgaben zu programmieren.
- Go
- Programmiersprache von Google für effiziente, parallele Systemprogrammierung; wird für Backend-Services, CLI-Tools und Cloud-Anwendungen verwendet.
- Nvidia
- Hersteller von Grafikprozessoren (GPUs) und Halbleitern, deren Hardware häufig für Grafik, Gaming und künstliche Intelligenz eingesetzt wird.
- MLflow
- Open-Source-Framework zur Verwaltung des Machine-Learning-Lebenszyklus, einschließlich Experiment-Tracking und Modell-Deployment.
- Infrastructure as Code
- Methode, bei der IT-Infrastruktur (Server, Netzwerke, Speicher) durch Code definiert und automatisiert bereitgestellt wird.
- Monitoring
- Kontinuierliche Überwachung von Systemen, Anwendungen oder Prozessen zur Erfassung von Leistungsdaten und Erkennung von Problemen.
- Logging
- Technik zur automatischen Aufzeichnung von Ereignissen und Fehlern in Systemen, um Probleme zu analysieren und nachzuvollziehen.
- Alerting
- Benachrichtigungssystem, das automatisch Meldungen bei bestimmten Ereignissen oder Fehlern auslöst; wird in Überwachungs- und Monitoring-Systemen verwendet.
- Disaster Recovery
- Strategie und Maßnahmen zur Wiederherstellung von IT-Systemen nach Ausfällen oder Katastrophen; sichert Geschäftskontinuität.
- Prism
- Möglicherweise ein Datenanalyse- oder Visualisierungstool; ohne weitere Kontexte könnte es sich um verschiedene Produkte handeln, die Daten strukturieren oder darstellen.
- MLOps
- Praktiken und Tools zur Verwaltung von Machine-Learning-Modellen in Produktion, ähnlich wie DevOps für klassische Software – umfasst Training, Deployment, Monitoring und Wartung von KI-Systemen.
- Rancher
- Plattform zur Verwaltung und Orchestrierung von Kubernetes-Clustern über eine zentrale Oberfläche.
- OpenShift
- Container-Orchestrierungsplattform von Red Hat auf Basis von Kubernetes; verwaltet und skaliert containerisierte Anwendungen.
- GDPR
- Europäische Datenschutzverordnung, die Regeln für die Verarbeitung und den Schutz personenbezogener Daten vorschreibt.
- ISO 27001
- Internationale Norm für Informationssicherheitsmanagementsysteme; definiert Anforderungen zum Schutz von Daten und IT-Systemen.
Als IT-Freelancer automatisch auf Projekte wie dieses bewerben
Nexus ist die KI-gestützte Plattform für IT-Freelancer, die täglich neue Projektausschreibungen analysiert und passgenaue Bewerbungstexte generiert – vollautomatisch, in Sekunden. Kein manuelles Schreiben mehr: Nexus liest die Ausschreibung, erkennt die gefragten Skills und erstellt einen individuellen Bewerbungstext, den du per Klick versendest.
- ✓ Projektausschreibungen direkt von Anbietern aus dem DACH-Raum
- ✓ KI-Bewerbungstext in unter 30 Sekunden – individuell auf jedes Projekt zugeschnitten
- ✓ Automatischer Versand per E-Mail + Anlage in Pipedrive
- ✓ Kostenlos starten – keine Kreditkarte erforderlich
Häufige Fragen zu Nexus
- Was ist Nexus und für wen ist es geeignet?
- Nexus richtet sich an selbstständige IT-Freelancer, die regelmäßig auf Projektausschreibungen antworten. Die Plattform automatisiert den gesamten Bewerbungsprozess – von der Analyse der Ausschreibung bis zum Versand der Bewerbung.
- Wie schreibt Nexus den Bewerbungstext?
- Nexus analysiert die Projektbeschreibung mit Claude (Anthropic) und gleicht die Anforderungen mit deinem hinterlegten Profil ab. Der generierte Text ist individuell, professionell und direkt versendbar – du kannst ihn vor dem Absenden noch anpassen.
- Welche Projektplattformen werden unterstützt?
- Nexus erhält Projekte direkt von Projektanbietern aus dem DACH-Raum – neue Ausschreibungen erscheinen automatisch in deiner Pipeline, ohne dass du Plattformen manuell durchsuchen musst.
- Kostet Nexus etwas?
- Der Einstieg ist dauerhaft kostenlos. Für professionelle Nutzung mit erweiterten Funktionen gibt es kostenpflichtige Pläne – ohne versteckte Kosten oder automatische Verlängerung.
Passende Freelancer
Profile die zu den Skills dieses Projekts passen
- Enterprise Architect | AI Platform Strategist | Technology Consultant100 €/h
Enterprise Architect und AI Platform Strategist mit über 25 Jahren Erfahrung in der Entwicklung, Architektur und Skalierung komplexer Softwareplattformen sowie der Integration moderner AI-Technologien in Enterprise-Umgebungen.
- Senior Backend Developer68 €/h
20+ Jahre Java, 15+ Jahre PHP, 10+ Jahre Frontend – Senior Fullstack-Entwickler mit umfassender Expertise in modernen Web- und Cloud-Technologien.
- Senior AI Automation Engineer60 €/h
AI Automation Engineer mit Fokus auf agentische Workflows, LLM-Integration, Fullstack-Entwicklung und intelligente Prozessautomatisierung.
- Senior IT-Berater / Digitalisierungsexperte für Pensionsverwaltung
- IT-Consultant / Full-Stack Developer
Nie wieder Bewerbungen schreiben.
Nexus matcht deine Skills und schreibt Bewerbungen automatisch.
Kostenlos registrieren →Keine Kreditkarte erforderlich
Tipp
Zeiterfassung & Projektverwaltung
Projekte, Stunden und Rechnungen in einer App. Flow ist die schlanke Lösung für IT-Freelancer und Agenturen – kostenlos starten.
Flow ausprobierenÄhnliche Projekte
- Kubernetes Administrator / Private Cloud Engineer (m/w/d)
- Cloud Developer – Infrastructure & Automation (m/w/d)
- AWS Cloud Migration und Betrieb für Personenbeförderungsunternehmen
- Cloud Architecture & Azure Implementation Consultant
- AWS Solutions Architect mit Python und CI/CD Expertise
- Cloud Architect (m/w/x)
- Appian Support Engineer (L2/L3) – Appian, AWS & Data (German-Speaking)
- VMware Cloud Foundation (VCF) Architect
- Power Platform Developer
- Cloud-Architekt IoT & Thingsboard Integration
- E2E Tester Mobilfunk (m/w/d)
- IT-Change-Manager (m/w/d) - Releasemanagement & CI/CD
- DevOps Engineer (m/w/d)
- DevOps Engineer (m/w/d)
- DevOps Engineer (m/w/d)
Tipp
Konferenzraum in Hamburg
Für das nächste Kunden- oder Teammeeting in Hamburg: vollausgestattet mit Beamer, Whiteboard und Videokonferenz – ab 49 €/h, direkt am Gänsemarkt.
Konferenzraum mieten