JOB DESCRIPTION
Role : Data Platform Infrastructure Engineer with Databricks
Location : Scottsdale AZ (onsite)
Preferred Skill Combination (Must-Have Exposure to One or Both):
1. Cloudera + Databricks + Terraform + AWS
Role Overview:
We are seeking a highly skilled Data Platform Infrastructure Engineer to design, build, and manage scalable data platforms across on-premise and cloud environments. The role involves working with cluster technologies, infrastructure automation, and modern data ecosystems to enable reliable and high-performing data platforms.
Key Responsibilities:
1. Design, deploy, and manage data platform infrastructure across on-prem (Cloudera) and cloud (AWS, Databricks) environments
2. Build and maintain distributed data clusters ensuring high availability, scalability, and performance
3. Automate infrastructure provisioning using Terraform and Ansible
4. Manage and optimize Cloudera Hadoop ecosystems (HDFS, Hive, Spark, YARN, etc.)
5. Deploy and manage Databricks workspaces, clusters, and integrations on AWS
6. Implement infrastructure-as-code (IaC) and configuration management best practices
7. Monitor cluster performance, troubleshoot issues, and ensure system reliability
8.
Collaborate with data engineers, architects, and DevOps teams to support data pipelines and analytics workloads
9. Ensure security, compliance, and governance across data platforms
10. Support migration from on-prem to cloud-based data platforms
Technical Skills Required:
Core Technologies:
1. Strong experience in Cloudera (CDH/CDP) cluster setup and administration
2. Hands-on experience with Databricks (cluster management, jobs, notebooks)
3. Strong exposure to AWS (EC2, S3, IAM, VPC, EMR, networking concepts)
Infrastructure & Automation:
1. Expertise in Terraform (mandatory) for infrastructure provisioning
2. Proficiency in Ansible for configuration management and automation
3. Experience with CI/CD pipelines for infrastructure deployments
Cluster & Data Technologies:
1. Experience managing distributed systems / cluster technologies
2. Solid understanding of:
3. Hadoop ecosystem (HDFS, Hive, Spark, Kafka, etc.)
4. Spark performance tuning and cluster optimization
5. Knowledge of containerization (Docker/Kubernetes) is a plus
📌 Data Platform Infrastructure Engineer with Databricks (Dehradun)
🏢 Git
📍 Dehradun