Website ADP

Data Engineer – ADP (Automatic Data Processing)

Opportunity Overview

Attribute Details
Organisation ADP (Automatic Data Processing)
Position Title Data Engineer
Experience Requirement 4 – 10 years of dedicated experience in PySpark and Databricks
Primary Location Hyderabad, Telangana, India
Department / Practice Data & Global Analytics
Employment Type Full-Time, Permanent
Target Sector HR Technology, Payroll & Enterprise SaaS
Core Technical Stack PySpark, Databricks, Python, AWS Ecosystem, SQL, ETL Pipelines
Differentiators (Good to Have) Tableau (data visualisation & dashboard integration)

Data Pipeline & Validation Architecture

The Data Engineer at ADP focuses on consolidating complex, disparate HR and financial datasets into a cohesive data platform using PySpark and Databricks on AWS:

┌───────────────────────────────────────────┐
│ 1. Disparate Source Integration           │ ➔ Extract & integrate complex multi-source HR/Payroll datasets into AWS
└─────────────────────┬─────────────────────┘
                      ▼
┌───────────────────────────────────────────┐
│ 2. PySpark & Databricks ETL Processing    │ ➔ Build high-performance batch pipelines using Spark SQL and PySpark
└─────────────────────┬─────────────────────┘
                      ▼
┌───────────────────────────────────────────┐
│ 3. Automated Validation & Quality Checks  │ ➔ Implement strict automated data validation frameworks for accuracy & consistency
└─────────────────────┬─────────────────────┘
                      ▼
┌───────────────────────────────────────────┐
│ 4. Downstream Analytics & Visualization   │ ➔ Expose clean datasets to enterprise analytics teams and Tableau dashboards
└───────────────────────────────────────────┘

Key Responsibilities

  • ETL Pipeline Development: Design, build, and maintain scalable ETL/ELT pipelines supporting large-scale enterprise analytics and operational reporting.

  • Disparate Data Integration: Unify data feeds from multiple disparate sources into a structured, central data platform.

  • Data Validation & Integrity: Implement automated validation rules and auditing processes to ensure high data accuracy, schema consistency, and compliance.

  • Query & Compute Optimization: Leverage PySpark, Spark core, and Databricks optimization techniques to accelerate data processing and query execution.

  • Cross-Functional Collaboration: Partner with analytical teams and product stakeholders to deliver clean data solutions and optional Tableau dashboards.

Qualification Matrix & Technical Skill Stack

Core Requirements

Category Specifications
Professional Experience 4 to 10 years of overall experience, with strong focus on PySpark and Databricks.
Core Data Engine Advanced proficiency in PySpark, Spark SQL, and Databricks Platform.
Programming & Querying Strong hands-on experience in Python scripting and advanced SQL.
Cloud Infrastructure Working experience within the Amazon Web Services (AWS) cloud ecosystem (S3, EMR/Databricks on AWS, IAM).
Data Quality & Viz Expertise in building data validation frameworks; working knowledge of Tableau is a plus.

Key Focus Areas for Interview Preparation

  1. PySpark Memory Management & Performance Tuning: Practice explaining broadcast joins, repartitioning vs. coalescing, caching strategies, and handling data skewness in Spark jobs.

  2. Data Validation Framework Design: Be prepared to detail how you build automated data assertion pipelines (e.g., row count checks, null-value checks, schema evolution handling).

  3. AWS & Databricks Integration: Review best practices for executing Databricks workloads against AWS S3 data lakes and setting up cost-effective cluster configurations.

Upload your CV/resume or any other relevant file. Max. file size: 2 GB.