Auf einen Blick
Senior Reliability Engineer für regionale Incident-Response und Tier-2-Support in Penang, Malaysia mit Automation und DevOps-Fokus.
💰 ~$65.000–95.000/Jahr (geschätzt)
📊 Senior
🕒 Vollzeit
🌍 Hybrid
🗺️ APAC
- Bachelor in Informatik/Ingenieurwesen
- 5+ Jahre Reliability Operations
- Tier-2/3 Untersuchungserfahrung
- Linux-Kompetenz
Linux
Incident Management
Automation
Grafana/Prometheus
Runbook-Entwicklung
Python/Bash
Gehalt geschätzt anhand Senior Reliability Engineer mit 5+ Jahren Erfahrung, Malaysia-basiert mit APAC-Zeitzone. Kein Gehalt in der Anzeige angegeben.
✅ Geeignet für
- DevOps/SRE-Profis mit APAC-Erfahrung
- Linux-Experten mit Incident-Management
- Automation-spezialisierte Ingenieure
🚫 Weniger geeignet
- Anfänger ohne Reliability Ops
- Personen ohne Linux-Kenntnisse
- Diejenigen mit Scheu vor On-Call-Rotation
💡 Gut zu wissen
- Penang, Malaysia-Standort
- APAC-Zeitzone für daytime Incident-Lead
- Wochenend-On-Call-Rotation erforderlich
Über das Unternehmen
Serve Robotics erfindet neu, wie sich Dinge in Städten bewegen. Ein hochqualifiziertes Team von Tech-Veteranen arbeitet an realen Problemen mit Robotik, maschinellem Lernen und Computer Vision.
Deine Aufgaben
- Leite regionale Operational Reliability mit Incident Response und Tier-2-Support für Robotik und Cloud-Systeme
- Fungiere als primärer Incident-Lead während regionaler Geschäftszeiten
- Reagiere auf Eskalationen von Tier-1-Support mit Runbooks und Systemdiagnostik
- Entwickle und aktualisiere Runbooks und operative Dokumentation
- Schreibe und warte Automatisierungs-Skripte zur Verbesserung der Response-Zeiten
- Nutze Metriken und Tracing-Tools wie Grafana/Prometheus für proaktive Problemerkennung
- Fungiere als zentraler Kommunikationspunkt während aktiver Incidents
- Arbeite mit Reliability- und Produkt-Teams zusammen
- Partizipiere in geteilter Wochenend-On-Call-Rotation
Deine Voraussetzungen
- Bachelor in Informatik, Informationstechnologie, Ingenieurwesen oder gleichwertige praktische Erfahrung
- 5+ Jahre Erfahrung in Reliability Operations, Site Reliability Engineering oder DevOps
- Nachgewiesene Erfahrung mit Tier-2 oder Tier-3 technischen Untersuchungen
- Erfahrung mit verteilten Systemen und Cloud-gehosteten Services
- Praktische Erfahrung mit Incident-Response-Prozessen
- Starke Linux-Kompetenz
- Erfahrung mit Runbooks und Automatisierungs-Workflows
- Fähig, Metriken mit Grafana/Prometheus zu interpretieren