Azure Senior Data Lead
Technology, Data & Digital · Data, AI & Analytics · Data Engineering
In short
Wir suchen einen erfahrenen Senior Azure Databricks Data Engineer zur Modernisierung bestehender Python OOP-Anwendungen in skalierbare PySpark- und Spark SQL-basierte Datenverarbeitungslösungen auf Azure. Die Rolle erfordert tiefgreifende Expertise in Python OOP, verteilten Systemen und Cloud-Architektur zur Optimierung der Leistung und Erstellung robuster Datenpipelines auf Azure.
Responsibilities
- Analyse bestehender Python OOP-Anwendungen, Bibliotheken und Frameworks.
- Refactoring und Konvertierung von objektorientiertem Python-Code in skalierbare PySpark-basierte verteilte Verarbeitungslösungen.
- Identifizierung von Engpässen in Single-Node-Python-Anwendungen und deren Neugestaltung für Spark-Ausführung.
- Umwandlung von prozeduraler und klassenbasierter Geschäftslogik in DataFrame-basierte Verarbeitungsmuster.
- Modernisierung von Legacy-ETL-Frameworks in Cloud-native Spark-Architekturen.
- Entwurf, Entwicklung und Bereitstellung von Enterprise-Scale-Datenpipelines mit Azure Databricks.
- Erstellung wiederverwendbarer PySpark-Frameworks, Bibliotheken und Utility-Module.
- Entwicklung von Spark SQL-Transformationen für Big-Data-Analytics-Workloads.
- Implementierung von Delta Lake-basierten Lösungen mit Bronze-Silver-Gold-Architektur.
- Optimierung von Spark-Jobs hinsichtlich Leistung, Skalierbarkeit und Kosteneffizienz.
- Entwurf robuster ETL/ELT-Pipelines unter Verwendung von Azure Databricks, Azure Data Factory, ADLS Gen2, Delta Lake und Azure Synapse Analytics.
- Verarbeitung von strukturierten, semistrukturierten und unstrukturierten Daten aus mehreren Unternehmensquellen.
- Implementierung von Frameworks für Datenqualität, Abgleich, Validierung und Überwachung.
- Optimierung von Spark-Jobs durch Partitionierung, Bucketing, Caching, Broadcast Joins, Adaptive Query Execution und Delta Optimization Techniques.
- Benchmark-Vergleich konvertierter PySpark-Anwendungen mit ursprünglichen Python-Implementierungen.
- Reduzierung der Ausführungszeit und Verbesserung der Skalierbarkeit für Big-Data-Workloads.
Requirements
- Relevante Zertifizierungen in Azure Data Factory, Azure Databricks, SQL, Oracle oder Python sind von Vorteil.
Desired Qualifications
- Expert Level Python
- Advanced Python Design Patterns
- Data Lakehouse Architecture
- Distributed Computing Concepts
Benefits
- Branchenbenchmarked compensation
- Best-in-class healthcare benefits
- Personal time off
- Maternity and paternity benefits
- Access to skills / higher education programs/resources
- Discounts on products and services via Benefit Box
- Participate in CSR programs and live life with a purpose
- Opportunities to grow and advance your career
#Azure#Data Engineering#Python#PySpark#Spark SQL#Databricks#ETL#Data Pipelines#Big Data#Cloud