
(Senior) Site Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)
STACKIT · Stadt Heilbronn, Baden-Württemberg, Germany
About this role
The candidate will operate and optimize highly complex platforms using Kubernetes, KubeVirt, Cilium, Ceph, and Talos, focusing on end-to-end stability, scalability, and cost. Responsibilities include developing and maintaining monitoring and logging systems (Metrics, Logs, Traces) observabilityability-focused. The role involves implementing synthetic monitoring and trace tests to validate critical services. The engineer will define and monitor Service Level Objectives (SLOs) and reduce toil-through-code to automate processes. The position requires a stable foundation in cloud infrastructure and cloud-native technologies.
Skills & technologies
Must have
- Kubernetes
- KubeVirt
- Cilium
- Ceph
- Talos
- Monitoring
- Logging
- Observability
- Golang
- Cloud Infrastructure
- Virtualization
Nice to have
- null
Read full description
Bei uns arbeitest du an der Schnittstelle zwischen Agilität und Sicherheit: Du profitierst von den schnellen Entscheidungswegen, genießt echte Gestaltungsspielräume in deinen Projekten und baust dabei auf das stabile Fundament der Schwarz Gruppe.
Deine Aufgaben
- Du betreibst und optimierst unsere hochkomplexen Plattformen (Kubernetes, KubeVirt, Cilium, Ceph, Talos) sowie die zugrundeliegende Infrastruktur mit dem Fokus auf End-to-End-Stabilität, Skalierbarkeit und Kosten.
- Du entwickelst und pflegst unsere Monitoring- und Logging-Systeme (Metrics, Logs, Traces), um jederzeit tiefgreifende Einblicke in den Systemzustand zu gewährleisten und proaktiv Engpässe zu erkennen.
- Du implementierst konsequentes Synthetic Monitoring und Tracetests, um die End-to-End-Funktionalität kritischer Services kontinuierlich zu validieren.
- Du definierst und überwachst klare Service Level Objectives (SLOs) und reduzierst 'Toil' konsequent durch Code. Runbooks sind für dich nur die letzte Verteidigungslinie.
- Du dokumentierst deine Arbeit nachvollziehbar, denn das beste System ist wertlos ohne ein gutes Markdown.
- Du hast ein abgeschlossenes Studium in Informatik oder einem verwandten Fachgebiet.
- Mindestens 2 Jahre aktive Erfahrung als SRE/DevOps Engineer, wo du gelernt hast, dass 'Works on my machine' keine Antwort ist.
- Fundierte Erfahrung im Betrieb von Cloud-Infrastrukturen mit Kubernetes und/oder Virtualisierungstechnologien.
- Du hast gute Kenntnisse in der Softwareentwicklung mit Golang oder einer vergleichbaren Systemsprache und nutzt diese, um Abläufe zu automatisieren und eigene Tools zu bauen.