Auf einen Blick
Leite Emerald Entity Resolution Platform bei H1 in New York. 8+ Jahre Distributed Data Systems Erlebnis mit Entity Matching Expertise erforderlich; scale Pipelines für Healthcare Provider Linking.
💰 ~$200.000–300.000/Jahr (geschätzt)
📊 Senior
🕒 Vollzeit
🗺️ Americas
- Deep Expertise mit Apache Spark und Hadoop in AWS
- Python/PySpark, Scala oder Java Programmierungs-Kompetenz
- Erfahrung mit skalierbaren ETL/ELT Frameworks
- Entity Resolution, Matching Algorithms oder Data Deduplication Erlebnis
Data Engineering
Spark/PySpark
Entity Resolution
Python
AWS
Gehalt geschätzt anhand Staff-level data engineer with entity resolution expertise, specialized domain, New York. Kein Gehalt in der Anzeige angegeben.
✅ Geeignet für
- Staff-Level Data Engineers mit Entity Matching oder Deduplication Erlebnis
- Spark/PySpark Spezialisten mit großflächiger Data Processing Erlebnis
- Ingenieure, die in Healthcare oder Identity Resolution arbeiten möchten
🚫 Weniger geeignet
- Junior oder Mid-Level Engineers ohne spezialisierte Expertise
- Menschen ohne Spark oder Large-Scale Processing Erlebnis
- Kandidaten, die nicht mit komplexen Matching-Problemen arbeiten möchten
💡 Gut zu wissen
- Entity Resolution ist ein spezialisiertes Feld – Matching Algorithms sind kritisch
- Emerald linkt diverse Datenquellen (PubMed, Trials, ct.gov) zu Physician Profiles
- Staff-Level bedeutet hohe Technical Direction und Autonomous Ownership
Über das Unternehmen
H1 ist eine Healthcare-Intelligence-Plattform mit Mission, Ärzte weltweit mit Informationen zu versorgen. Die Emerald Platform ist H1's Healthcare Entity Resolution System, das großflächige externe Healthcare Datasets zu H1's kanonischen Physician und Organization Profiles linkt.
Deine Aufgaben
- Leite Design, Optimierung und Skalabilität von verteilten Spark/PySpark Pipelines für Entity Resolution
- Verantworte Systeme, die Automatching, Identity Mapping, Grouping Logic, Deduplication und Enrichment Workflows über Millionen von Records stützen
- Baue skalierbare Processing Frameworks für PubMed, Clinical Trials, ct.gov, Konferenzen und andere Healthcare Datenquellen
- Treibe Infrastructure Optimization für Throughput, Runtime, Observability und Cloud Compute Cost Efficiency
- Arbeite mit AI/ML Teams zusammen zur Integration von Matching und Resolution Models
- Leite komplexe Technical Initiatives von Architektur bis Deployment und Production Support
- Fungiere als Technical Leader und Mentor über das Team
- Arbeite direkt mit Product und Business Stakeholders zusammen
Deine Voraussetzungen
- Deep Expertise mit Apache Spark und Hadoop, besonders in AWS Umgebungen
- Starke Kompetenz in Python (PySpark), Scala, Java oder moderne Programmiersprachen
- Erfahrung beim Bauen skalierbarer ETL/ELT Frameworks über Batch und Streaming
- Erfahrung mit Entity Resolution, Matching Algorithms oder Data Deduplication (von Vorteil)
Benefits
- Staff-Level IC Position
- Entity Resolution Platform Leadership