Unser Kunde ist ein etabliertes Unternehmen, das seit 25 Jahren mit rund 500 IT-Expert:innen Unternehmen bei der Digitalisierung und Agilisierung ihres Kerngeschäfts unterstützt. Im Team IT Engineering & Operations entwerfen und implementieren sie innovative IT-Infrastrukturen und entwickeln bestehende Systeme weiter. Als Cloud Engineer liegt dein Schwerpunkt auf der Implementierung moderner Data- und AI-Infrastrukturen. Du orchestrierst GPU-Cluster, strukturierst Datenplattformen und automatisierst Pipelines für ein effizientes Modell-Training sowie den stabilen Betrieb von Inferenz-Schnittstellen. Du konzipierst Datenplattformen, von der Storage-Architektur über Lakehouse-Formate bis zur Integration von Orchestrierung und Streaming-Komponenten. Tools wie Airflow, Spark on Kubernetes oder Ray setzt du ein und integrierst sie, um sicherzustellen, dass Data- und ML-Workflows zuverlässig in Produktion laufen. Infrastructure-as-Code und GitOps sind für dich Standard. Bei sensiblen Datenprodukten baust du Sicherheit von Beginn an ein, einschließlich Network Policies und Anforderungen aus der Data Governance. Monitoring, Incident-Handling und GPU-Kapazitätsplanung liegen in deiner Verantwortung. In den Projekten werden Technologien wie AWS, Azure, Google Cloud, Kubernetes, Terraform und viele weitere eingesetzt. Du hast die Möglichkeit, deinen technologischen Schwerpunkt jederzeit zu verlagern und jüngere Kolleg:innen durch Mentoring zu unterstützen. Das Arbeitsumfeld ist geprägt von flachen Hierarchien, selbstorganisierten und agilen Teams sowie einem starken Zusammenhalt.
Cloud Engineer für Data & AI
Beschreibung
Anforderungen
Der ideale Kandidat hat entweder ein Studium oder eine Ausbildung im IT-Bereich abgeschlossen, wobei die fachlichen Fähigkeiten und die Persönlichkeit im Vordergrund stehen. Du solltest fundierte Kubernetes-Erfahrung im produktiven Betrieb mitbringen und tiefgehende Kenntnisse im Umgang mit einem der großen Cloud-Provider (AWS, Azure, Google Cloud) haben. Der routinierte Einsatz von Infrastructure-as-Code ist für dich selbstverständlich. Du verstehst, wie Storage-Architekturen für unterschiedliche Workloads ausgelegt werden und hast Erfahrung in Workflow-Orchestrierung, Streaming, GPU-Scheduling und Model Serving. Netzwerk-Härtung und Security Best Practices denkst du von Anfang an mit. Der Umgang mit KI-Tools ist dir vertraut, und du kannst komplexe technische Zusammenhänge auch nicht-technischen Ansprechpartner:innen vermitteln. Sehr gute Deutschkenntnisse (mindestens C1) und gute Englischkenntnisse sind erforderlich. Persönliche Eigenschaften wie Teamfähigkeit, Kommunikationsstärke und analytisches Denken runden dein Profil ab.