
Cloud Infrastructure SRE Engineer - STACKIT (m/w/d)
STACKIT · Bad Friedrichshall, Baden-Württemberg, Germany
About this role
As a member of the IaaS SRE team, you will focus on building and scaling a high-performance cloud platform based on OpenStack. Your responsibilities include automating technical processes using Golang or Python and managing Baremetal resources via OpenStack Ironic. You will maintain Linux-based environments, including Kubernetes and Proxmox, to ensure high availability. Additionally, you will implement monitoring and logging solutions such as Prometheus, Grafana, and the ELK Stack. You will work in a collaborative team environment dedicated to continuous improvement and technical excellence.
Skills & technologies
Must have
- Linux
- OpenStack
- Golang
- Python
- Kubernetes
- Proxmox
- Prometheus
- Grafana
- ELK Stack
- Automation
Read full description
Bei uns arbeitest du an der Schnittstelle zwischen Agilität und Sicherheit: Du profitierst von den schnellen Entscheidungswegen, genießt echte Gestaltungsspielräume in deinen Projekten und baust dabei auf das stabile Fundament der Schwarz Gruppe.
Deine Aufgaben
- Du bist Teil des Infrastructure-as-a-Service Site-Relialibty-Engeering (IaaS SRE) Teams und unterstützt den Aufbau einer hoch performanten Cloud-Plattform auf Basis von OpenStack mit Fokus auf Skalierung und Erweiterung über Rechenzentrums- und Landesgrenzen hinaus
- Du betreibst und optimierst kontinuierlich die technischen Prozessabläufe durch effiziente Automatisierung und Weiterentwicklung in den Programmiersprachen Golang und/oder Python
- Du verantwortest und optimierst die Bereitstellung von Baremetal-Resourcen verschiedenster Hersteller auf Basis von OpenStack Ironic und internen und/oder OpenSource-basierten Tools
- Du betreibst und verwaltest die umgebende Linux-basierten Systemlandschaften (z.B. Kubernetes, Proxmox) und gewährleistest die hohe Verfügbarkeit unserer Cloud-Infrastruktur
- Du erstellst und pflegst Dokumentationen und sorgst für die Implementierung und Wartung von Monitoring und Logging (z.B. Prometheus, Grafana, ELK Stack) für einen stabilen Betrieb der Plattform
- Du bist Teil eines motivierten Teams, das jederzeit nach Verbesserungen strebt und sich (und die Produkte) kontinuierlich weiterentwickelt
- Du bringst die Leidenschaft und Begeisterung für neue Technologien und Themen rund um Linux, Automatisierung, Virtualisierung und Netzwerk mit
- Du treibst aktiv die Verbesserung der Verfügbarkeit und Skalierung voran und bist bestrebst Prozessabläufe zu automatisieren
- Du bist in der Lage, technische Probleme zu analysieren und zu lösen und hast Erfahrung in der Durchführung von Root Cause Analysen
- Du hast mehrjährige Erfahrung in der Implementierung und Verwaltung von Kubernetes-Umgebungen, einschließlich der Bereitstellung und Skalierung
- Du hast mehrjährige Erfahrung im Bereich der Softwareentwicklung, bis hin zu Build- und Releasemanagement, und überzeugst uns mit deiner Programmiererfahrung, insbesondere in Python und/oder Golang