AI Inference Engineer

Remote | United States • Remote • Mid-Level • vor 5 Tagen
Backend-Entwickler AI Data Engineer Software Engineer
Auf einen Blick

AI Inference Engineer bei Fuse Energy (Remote USA) – eine Gründungs-Engineering-Rolle für Large-Scale Inference Serving Systems mit direktem CTO-Reporting und GPU/CUDA-Integration.

💰 ~$150.000–220.000/Jahr (geschätzt) 📊 Senior 🕒 Vollzeit 🌍 Remote 🗺️ Americas
  • 4+ Jahre Large-Scale Inference Serving Systems
  • Tiefe Hands-on Erfahrung mit Inference Frameworks
  • Starkes Systems-Denken
  • Track Record mit Architecture Decisions
CUDA Inference Serving

Gehalt geschätzt anhand Senior AI Inference Engineer mit Large-Scale Systems Erfahrung. Kein Gehalt in der Anzeige angegeben.

✅ Geeignet für
  • Erfahrene Inference Engineers mit Large-Scale System Background
  • CUDA/GPU Programmers, die zu ML Infrastructure wechseln möchten
  • Techniker, die Gründungs-Rollen mit hohem Impact lieben
🚫 Weniger geeignet
  • Machine Learning Researchers ohne Inference System-Erfahrung
  • Menschen ohne 4+ Jahre Large-Scale Serving
  • Jemand, der nicht ohne Playbook arbeiten kann (Gründungs-Rolle)
💡 Gut zu wissen
  • Dies ist eine Gründungs-Rolle – kein etabliertes Team, mit dir fängst du an
  • Inference Optimization (Quantization, Distillation, etc.) ist zentral
  • GPU/CUDA Integration ist kritisch – nicht rein Software-Stack
  • High-Stakes Architecture Decisions ohne etabliertes Playbook erforderlich

Über das Unternehmen

Fuse Energy ist ein Energy-Startup mit dem Ziel, Energie reichlich vorhanden und erschwinglich zu machen. Das Unternehmen wurde mit über 200 Millionen US-Dollar von Top-Investoren finanziert und baut ein vollständig integriertes Energiesystem.

Deine Aufgaben

  • Definiere Fuses Inference-Serving-Strategie und Architektur von First Principles
  • Baue die Serving-Stack: Request-Routing, Batching, Scheduling und Autoscaling für High-Throughput, Latency-Sensitive Inference Workloads
  • Besitze Model-Level Optimierung Strategie für Serving (Quantization, Distillation, Speculative Decoding)
  • Entscheide über Core Software-Architektur für Serving-Frameworks (vLLM, TensorRT-LLM, SGLang, Triton)
  • Übersetze Throughput, Latency und Uptime Commitments in konkrete Technical Specs
  • Sei direkter Technical Owner von Inference Performance und Reliability
  • Arbeite eng mit CUDA/GPU Engineers zusammen
  • Setze Standards, Tooling und Benchmarks

Deine Voraussetzungen

  • 4+ Jahre beim Bauen oder Operieren von Large-Scale Inference Serving Systems
  • Tiefe, Hands-on Erfahrung mit Inference Serving Frameworks
  • Starkes Systems-Denken und Verständnis von Request-to-Response Pfade
  • Komfortabel, direkt mit GPU/CUDA Engineers zusammenzuarbeiten
  • Track Record beim Treffen High-Stakes Architecture Decisions
  • Comfort Operating ohne Playbook – Founding Role für neue Function