Site Reliability Engineer

Taipei City, Taiwan Vor Ort Mid-Level 05.07.2026
Site Reliability Engineer DevOps IT
Auf einen Blick

Entwerfe und verwalte hochgradig zuverlässige, beobachtbare Cloud- und Edge-Infrastruktur, indem du SLO-Management, Monitoring-Systeme und Automation orchestrierst und On-Call Incident Response führst.

💰 ~$100.000–140.000/Jahr (geschätzt) 📊 Mid-Level 🕒 Vollzeit 🌍 Vor Ort 🗺️ APAC
  • 3+ Jahre SRE, DevOps oder Platform Engineering
  • Hands-On Cloud Platform Erfahrung (AWS oder ähnlich)
  • Strong Observability und Monitoring Tool Knowledge
  • Linux Administration und Scripting
Kubernetes AWS Docker Terraform Prometheus Grafana Python Bash

Gehalt geschätzt anhand Site Reliability Engineer mit 3+ Jahren Erfahrung, AWS und Kubernetes Mastery in Taiwan. Kein Gehalt in der Anzeige angegeben.

✅ Geeignet für
  • DevOps oder Platform Engineers mit SRE Transition Intresse
  • Candidates mit Kubernetes und Cloud Infrastructure Expertise
  • On-Call Incident Leaders mit Automation Passion
🚫 Weniger geeignet
  • Pure Sysadmins ohne Cloud oder Container Erfahrung
  • Candidates ohne Scripting oder Automation Erfahrung
  • Personen, die keine On-Call Rotationen moegen
💡 Gut zu wissen
  • SRE ist Mindset kombined mit Automation und Reliability Focus
  • SLO/SLI Definitions sind zentral und erfordern Business-Alignment
  • On-Call Rotationen sind Teil der Rolle; Incident Response ist nicht optional

Über das Unternehmen

Der Client ist ein innovatives Technologie-Unternehmen, das grosse Cloud- und Edge-Infrastruktur betreibt, die AI-getriebene Produkte und Services unterstützen. Waehrend die Plattform expandiert, wird ein Site Reliability Engineer gesucht, um hochzuverlaessige, beobachtbare und sichere Systeme zu bauen.

Deine Aufgaben

  • Entwerfe und verwalte Monitoring-, Alerting- und Dashboarding-Systeme über Cloud- und Edge-Umgebungen
  • Baue Sichtbarkeit in System-Health durch Metriken, Logs, Traces und Performance-Analytics
  • Definiere und verwalte SLIs, SLOs und Service Reliability Targets
  • Entwickle proaktive Monitoring und Anomalie-Detection Capabilities
  • Stelle sicher, dass die Observability allen Infrastruktur-Schichten dient
  • Partizipiere in On-Call Rotationen und Incident Management
  • Führe Troubleshooting während Produktion Incidents an
  • Automatisiere wiederholte operative Aufgaben

Deine Voraussetzungen

  • 3+ Jahre Site Reliability Engineering, DevOps, Platform Engineering oder Production Operations
  • Hands-On Erfahrung mit AWS oder anderen Major Cloud Platforms
  • Strong Understanding von Observability und Monitoring Tools (Grafana, Prometheus)
  • Solid Linux Administration und Troubleshooting Skills
  • Erfahrung mit Docker, Kubernetes und containerisierten Workloads
  • Infrastructure as Code Tools wie Terraform
  • Proficiency in Python, Bash oder ähnlichen Scripting Languages