Auf einen Blick
AI Inference Engineer bei Fuse Energy (Remote USA) – eine Gründungs-Engineering-Rolle für Large-Scale Inference Serving Systems mit direktem CTO-Reporting und GPU/CUDA-Integration.
💰 ~$150.000–220.000/Jahr (geschätzt)
📊 Senior
🕒 Vollzeit
🌍 Remote
🗺️ Americas
- 4+ Jahre Large-Scale Inference Serving Systems
- Tiefe Hands-on Erfahrung mit Inference Frameworks
- Starkes Systems-Denken
- Track Record mit Architecture Decisions
CUDA
Inference Serving
Gehalt geschätzt anhand Senior AI Inference Engineer mit Large-Scale Systems Erfahrung. Kein Gehalt in der Anzeige angegeben.
✅ Geeignet für
- Erfahrene Inference Engineers mit Large-Scale System Background
- CUDA/GPU Programmers, die zu ML Infrastructure wechseln möchten
- Techniker, die Gründungs-Rollen mit hohem Impact lieben
🚫 Weniger geeignet
- Machine Learning Researchers ohne Inference System-Erfahrung
- Menschen ohne 4+ Jahre Large-Scale Serving
- Jemand, der nicht ohne Playbook arbeiten kann (Gründungs-Rolle)
💡 Gut zu wissen
- Dies ist eine Gründungs-Rolle – kein etabliertes Team, mit dir fängst du an
- Inference Optimization (Quantization, Distillation, etc.) ist zentral
- GPU/CUDA Integration ist kritisch – nicht rein Software-Stack
- High-Stakes Architecture Decisions ohne etabliertes Playbook erforderlich
Über das Unternehmen
Fuse Energy ist ein Energy-Startup mit dem Ziel, Energie reichlich vorhanden und erschwinglich zu machen. Das Unternehmen wurde mit über 200 Millionen US-Dollar von Top-Investoren finanziert und baut ein vollständig integriertes Energiesystem.
Deine Aufgaben
- Definiere Fuses Inference-Serving-Strategie und Architektur von First Principles
- Baue die Serving-Stack: Request-Routing, Batching, Scheduling und Autoscaling für High-Throughput, Latency-Sensitive Inference Workloads
- Besitze Model-Level Optimierung Strategie für Serving (Quantization, Distillation, Speculative Decoding)
- Entscheide über Core Software-Architektur für Serving-Frameworks (vLLM, TensorRT-LLM, SGLang, Triton)
- Übersetze Throughput, Latency und Uptime Commitments in konkrete Technical Specs
- Sei direkter Technical Owner von Inference Performance und Reliability
- Arbeite eng mit CUDA/GPU Engineers zusammen
- Setze Standards, Tooling und Benchmarks
Deine Voraussetzungen
- 4+ Jahre beim Bauen oder Operieren von Large-Scale Inference Serving Systems
- Tiefe, Hands-on Erfahrung mit Inference Serving Frameworks
- Starkes Systems-Denken und Verständnis von Request-to-Response Pfade
- Komfortabel, direkt mit GPU/CUDA Engineers zusammenzuarbeiten
- Track Record beim Treffen High-Stakes Architecture Decisions
- Comfort Operating ohne Playbook – Founding Role für neue Function