
Site Reliability Engineer - Cloud Infrastructure - STACKIT (m/w/d)
STACKIT · Bad Friedrichshall, Baden-Württemberg, Germany
About this role
The candidate will promote a culture of reliability by supporting engineering teams in operating resilient services with minimal manual effort. Key respons://The candidate will promote a culture of reliability by supporting engineering teams in operating resilient services with minimal manual effort. Key responsibilities include acting as a mentor and advisor to embed a "Reliability-First" mentality in development teams. The role involves managing holistic incident management, from acute crisis coordination as an Incident Commander, to sustainable error analysis (RCA) to ensure continuous system improvement. Additionally, the candidate will standardize operations processes and establish a Reliability Score to increase operative excellence. The role requires implementing tools to measure and control Service Level Objectives (SLOs).
Skills & technologies
Read full description
Bei uns arbeitest du an der Schnittstelle zwischen Agilität und Sicherheit: Du profitierst von den schnellen Entscheidungswegen, genießt echte Gestaltungsspielräume in deinen Projekten und baust dabei auf das stabile Fundament der Schwarz Gruppe.
Deine Aufgaben
- Du förderst eine Kultur der Zuverlässigkeit, indem du Engineering-Teams dabei unterstützt, resiliente Services mit minimalem manuellem Aufwand (Toil) zu betreiben.
- Du agierst als Mentor und Advisor, um die „Reliability-First“-Mentalität in den Entwicklungsteams zu verankern.
- Du steuerst das ganzheitliche Vorfallsmanagement – von der akuten Krisenkoordination als Incident Commander bis zur nachhaltigen Fehleranalyse (RCA) zur kontinuierlichen Systemverbesserung.
- Du standardisierst Operations-Prozesse und etablierst den Reliability Score, um die operative Exzellenz gemeinsam mit den Teams nachhaltig zu steigern.
- Du implementierst Werkzeuge zur Messbarkeit und Steuerung von Service Level Objectives (SLOs)
- Du verfügst über ein ausgeprägtes „Reliability-First“-Mindset und verstehst die Balance zwischen Geschwindigkeit und Stabilität.
- Du hast fundierte Erfahrung im Site Reliability Engineering (SRE) und kennst die Prinzipien von SLOs, Error Budgets und Toil-Management.
- Du bist sicher in der Durchführung von Root Cause Analyses (RCA) und der Ableitung von Maßnahmen zur Fehlervermeidung.
- Du besitzt gute Kenntnisse in der Entwicklung von Automatisierungsskripten oder internen Tools (z. B. Python, Go).
- Du hast Freude an der Zusammenarbeit mit verschiedenen Stakeholdern in einer dezentralen, europäischen Organisation.