Website Accenture
Data Engineer – Accenture (India)
Opportunity Overview
Databricks ETL & Cloud Analytics Architecture
The Data Engineer at Accenture operates as a Subject Matter Expert (SME), designing, optimising, and deploying enterprise-grade data pipelines using the Databricks Lakehouse Platform:
┌───────────────────────────────────────────┐
│ 1. Data Ingestion & Integration │ ➔ Extract raw structured/unstructured feeds using Databricks & Cloud Services
└─────────────────────┬─────────────────────┘
▼
┌───────────────────────────────────────────┐
│ 2. Pipeline Construction & ETL Scripting │ ➔ Develop transformation workflows in Python (PySpark) or Scala on Databricks
└─────────────────────┬─────────────────────┘
▼
┌───────────────────────────────────────────┐
│ 3. Data Modeling & Quality Assurance │ ➔ Build scalable dimensional schemas and enforce data validation protocols
└─────────────────────┬─────────────────────┘
▼
┌───────────────────────────────────────────┐
│ 4. Performance Monitoring & Optimization │ ➔ Optimize cluster compute, tune Delta Lake tables, and maintain production SLAs
└───────────────────────────────────────────┘
Key Responsibilities
-
Databricks Pipeline Engineering: Design, build, and maintain production ETL/ELT pipelines leveraging Databricks Unified Data Analytics Platform.
-
Independent Execution & SME Ownership: Work independently to solve complex data engineering issues, serving as a Subject Matter Expert within client delivery teams.
-
Cross-Functional Collaboration: Partner with data architects, analysts, and business stakeholders to translate raw data requirements into scalable storage schemas.
-
Pipeline Monitoring & Optimization: Continuously monitor production data workflows, tuning cluster configurations and query performance for speed and cost efficiency.
-
Data Migration & Integration: Execute secure data migration strategies to deploy data assets across disparate legacy and cloud systems.
Qualification Matrix & Technical Skill Stack
Core Requirements
Key Focus Areas for Interview Preparation
-
Databricks & Spark Optimization: Practice PySpark syntax, Spark performance tuning (partitioning, caching, broadcast joins), and Delta Lake features (Z-Ordering, Time Travel, Liquid Clustering).
-
ETL Design Scenarios: Prepare to walk through end-to-end data pipeline architectures handling batch and real-time streaming data on Databricks.
-
Data Quality & Schema Design: Review star-schema design principles, slow-changing dimensions (SCD Type 1/2), and data validation frameworks within Databricks pipelines.


Follow Us