Auf einen Blick
Entwerfe und verwalte hochgradig zuverlässige, beobachtbare Cloud- und Edge-Infrastruktur, indem du SLO-Management, Monitoring-Systeme und Automation orchestrierst und On-Call Incident Response führst.
💰 ~$100.000–140.000/Jahr (geschätzt)
📊 Mid-Level
🕒 Vollzeit
🌍 Vor Ort
🗺️ APAC
- 3+ Jahre SRE, DevOps oder Platform Engineering
- Hands-On Cloud Platform Erfahrung (AWS oder ähnlich)
- Strong Observability und Monitoring Tool Knowledge
- Linux Administration und Scripting
Kubernetes
AWS
Docker
Terraform
Prometheus
Grafana
Python
Bash
Gehalt geschätzt anhand Site Reliability Engineer mit 3+ Jahren Erfahrung, AWS und Kubernetes Mastery in Taiwan. Kein Gehalt in der Anzeige angegeben.
✅ Geeignet für
- DevOps oder Platform Engineers mit SRE Transition Intresse
- Candidates mit Kubernetes und Cloud Infrastructure Expertise
- On-Call Incident Leaders mit Automation Passion
🚫 Weniger geeignet
- Pure Sysadmins ohne Cloud oder Container Erfahrung
- Candidates ohne Scripting oder Automation Erfahrung
- Personen, die keine On-Call Rotationen moegen
💡 Gut zu wissen
- SRE ist Mindset kombined mit Automation und Reliability Focus
- SLO/SLI Definitions sind zentral und erfordern Business-Alignment
- On-Call Rotationen sind Teil der Rolle; Incident Response ist nicht optional
Über das Unternehmen
Der Client ist ein innovatives Technologie-Unternehmen, das grosse Cloud- und Edge-Infrastruktur betreibt, die AI-getriebene Produkte und Services unterstützen. Waehrend die Plattform expandiert, wird ein Site Reliability Engineer gesucht, um hochzuverlaessige, beobachtbare und sichere Systeme zu bauen.
Deine Aufgaben
- Entwerfe und verwalte Monitoring-, Alerting- und Dashboarding-Systeme über Cloud- und Edge-Umgebungen
- Baue Sichtbarkeit in System-Health durch Metriken, Logs, Traces und Performance-Analytics
- Definiere und verwalte SLIs, SLOs und Service Reliability Targets
- Entwickle proaktive Monitoring und Anomalie-Detection Capabilities
- Stelle sicher, dass die Observability allen Infrastruktur-Schichten dient
- Partizipiere in On-Call Rotationen und Incident Management
- Führe Troubleshooting während Produktion Incidents an
- Automatisiere wiederholte operative Aufgaben
Deine Voraussetzungen
- 3+ Jahre Site Reliability Engineering, DevOps, Platform Engineering oder Production Operations
- Hands-On Erfahrung mit AWS oder anderen Major Cloud Platforms
- Strong Understanding von Observability und Monitoring Tools (Grafana, Prometheus)
- Solid Linux Administration und Troubleshooting Skills
- Erfahrung mit Docker, Kubernetes und containerisierten Workloads
- Infrastructure as Code Tools wie Terraform
- Proficiency in Python, Bash oder ähnlichen Scripting Languages