16 Aug
|
Tata Consultancy Services
|
Pune
16 Aug
Tata Consultancy Services
Pune
Job Description: Data Engineer
Location: Mumbai / Pune
Experience: 5-10 years
Role Summary
The Data Engineer is responsible for building, maintaining, and operating reliable, scalable data systems that support analytics, reporting, and machine learning use cases.
The role focuses on deterministic data transformations, data quality, and system correctness, and partners closely with Data Scientists to operationalize models.
Key Responsibilities
Data Pipelines & Orchestration
- Design, build, and maintain ETL / ELT pipelines for analytics and ML workloads
- Use modern orchestration and transformation tools such as:
- Prefect, Airflow, Dagster, n8n
- dbt for transformations and data modelling
- Manage scheduling, retries, dependencies, backfills, and failure recovery
Data Modeling & Analytics Enablement
- Design and maintain analytics-ready schemas (fact/dimension models, marts)
- Implement business logic and metrics deterministically in SQL/dbt
- Ensure metric definitions are consistent and reproducible across teams
ML Enablement (Engineering)
- Build pipelines for:
- Model training data preparation
- Model evaluation data
- Batch or real-time inference
- Implement feature engineering logic provided by Data Scientists
- Compute and expose model performance metrics
Data Quality, Reliability & Observability
- Implement data validation, freshness checks, and anomaly detection
- Monitor pipeline health, performance, and costs
- Ensure data lineage, auditability, and reproducibility
Required Skills & Qualifications
- Strong proficiency in SQL and Python
- Experience with data warehouses / lakes
- Hands-on experience with:
- Orchestration tools (Prefect, Airflow, Dagster, n8n)
- dbt or equivalent transformation frameworks
- Solid understanding of:
- Statistics fundamentals (distributions, aggregates, confidence intervals)
- Model evaluation metrics (precision, recall, RMSE, AUC, etc.)
- Robust systems thinking: scalability, performance, fault tolerance
Accountability & Success Criteria
- Data pipelines are reliable, reproducible, and observable
- Metrics and features are computed correctly and consistently
- Models can be trained, evaluated, and served without data issues
Explicit NonResponsibilities
- Building or operating production data pipelines
- Orchestration, scheduling, or data platform reliability
- Managing SLAs for data or inference systems
📌 Data Engineer (Pune)
🏢 Tata Consultancy Services
📍 Pune