Azure Senior Data Lead

Technology, Data & Digital · Data, AI & Analytics · Data Engineering

In short

Wir suchen einen erfahrenen Senior Azure Databricks Data Engineer zur Modernisierung bestehender Python OOP-Anwendungen in skalierbare PySpark- und Spark SQL-basierte Datenverarbeitungslösungen auf Azure. Die Rolle erfordert tiefgreifende Expertise in Python OOP, verteilten Systemen und Cloud-Architektur zur Optimierung der Leistung und Erstellung robuster Datenpipelines auf Azure.

Responsibilities

  • Analyse bestehender Python OOP-Anwendungen, Bibliotheken und Frameworks.
  • Refactoring und Konvertierung von objektorientiertem Python-Code in skalierbare PySpark-basierte verteilte Verarbeitungslösungen.
  • Identifizierung von Engpässen in Single-Node-Python-Anwendungen und deren Neugestaltung für Spark-Ausführung.
  • Umwandlung von prozeduraler und klassenbasierter Geschäftslogik in DataFrame-basierte Verarbeitungsmuster.
  • Modernisierung von Legacy-ETL-Frameworks in Cloud-native Spark-Architekturen.
  • Entwurf, Entwicklung und Bereitstellung von Enterprise-Scale-Datenpipelines mit Azure Databricks.
  • Erstellung wiederverwendbarer PySpark-Frameworks, Bibliotheken und Utility-Module.
  • Entwicklung von Spark SQL-Transformationen für Big-Data-Analytics-Workloads.
  • Implementierung von Delta Lake-basierten Lösungen mit Bronze-Silver-Gold-Architektur.
  • Optimierung von Spark-Jobs hinsichtlich Leistung, Skalierbarkeit und Kosteneffizienz.
  • Entwurf robuster ETL/ELT-Pipelines unter Verwendung von Azure Databricks, Azure Data Factory, ADLS Gen2, Delta Lake und Azure Synapse Analytics.
  • Verarbeitung von strukturierten, semistrukturierten und unstrukturierten Daten aus mehreren Unternehmensquellen.
  • Implementierung von Frameworks für Datenqualität, Abgleich, Validierung und Überwachung.
  • Optimierung von Spark-Jobs durch Partitionierung, Bucketing, Caching, Broadcast Joins, Adaptive Query Execution und Delta Optimization Techniques.
  • Benchmark-Vergleich konvertierter PySpark-Anwendungen mit ursprünglichen Python-Implementierungen.
  • Reduzierung der Ausführungszeit und Verbesserung der Skalierbarkeit für Big-Data-Workloads.

Requirements

  • Relevante Zertifizierungen in Azure Data Factory, Azure Databricks, SQL, Oracle oder Python sind von Vorteil.

Desired Qualifications

  • Expert Level Python
  • Advanced Python Design Patterns
  • Data Lakehouse Architecture
  • Distributed Computing Concepts

Benefits

  • Branchenbenchmarked compensation
  • Best-in-class healthcare benefits
  • Personal time off
  • Maternity and paternity benefits
  • Access to skills / higher education programs/resources
  • Discounts on products and services via Benefit Box
  • Participate in CSR programs and live life with a purpose
  • Opportunities to grow and advance your career
#Azure#Data Engineering#Python#PySpark#Spark SQL#Databricks#ETL#Data Pipelines#Big Data#Cloud
HCLTech Logo

Company

HCLTech

Job Posted

3 weeks ago

Employment Type

Full Time

WorkMode

On Site

Experience Level

Senior

Locations

Bangalore, India

Applicants

Be an early applicant