As a Senior Software Engineer / Site Reliability Engineer (SRE) – Observability, you will play a key role in enhancing platform reliability, monitoring, and modernization initiatives across our cloud native environments. This position combines software engineering (60–70%) with site reliability engineering (30–40%), with a strong focus on Kubernetes, AWS, and observability platforms such as Datadog. You will design, implement, and maintain scalable monitoring solutions while driving platform reliability, performance, and operational excellence.
What You'll Do
- Design, implement, and maintain observability solutions using Datadog and related monitoring technologies.
- Configure and manage dashboards, alerts, APM, metrics, logs, and distributed tracing.
- Monitor and optimize Kubernetes-based, containerized, and microservices-driven applications.
- Integrate observability tools into AWS cloud environments and cloud-native services.
- Build and maintain API integrations to support monitoring and platform automation.
- Integrate observability into CI/CD pipelines to improve deployment visibility and operational insights.
- Automate monitoring, operational workflows, and repetitive tasks using Python and other scripting languages.
- Install, configure, and maintain Datadog agents, integrations, and secure platform configurations.
- Manage API keys, user roles, permissions, and access controls within observability platforms.
- Collaborate with engineering, DevOps, and infrastructure teams to improve platform reliability and performance.
- Lead proactive maintenance initiatives and continuous platform improvements to enhance scalability, stability, and operational efficiency.
- Troubleshoot production issues and implement long-term reliability improvements across distributed systems.
What You'll Need
- 5+ years of experience in Software Engineering, Site Reliability Engineering, or Platform Engineering.
- Strong proficiency in Python, JavaScript (Node.js), or Java.
- Hands-on experience designing, consuming, and integrating RESTful APIs.
- Robust experience working with Kubernetes, including deployment, operations, and monitoring.
- Experience with Datadog (preferred) or similar observability platforms such as Prometheus and Grafana.
- Strong understanding of application performance monitoring (APM), logging, metrics, tracing, dashboards, and alerting.
- Experience monitoring containerized and microservices-based architectures.
- Hands-on experience with AWS cloud services and cloud-native infrastructure.
- Experience integrating observability platforms into AWS environments.
- Experience integrating monitoring and observability into CI/CD pipelines.
- Strong scripting and automation skills, with Python preferred.
- Demonstrated ownership of platform reliability, scalability, and performance improvements.
- Proven ability to lead maintenance activities and drive continuous operational enhancements.
- Strong communication and collaboration skills in distributed, cross-functional teams.
Nice to Have
- Experience owning and operating internal engineering platforms.
- Familiarity with Go (Golang).
- Experience with additional observability platforms such as New Relic, Dynatrace, Elastic, or Splunk Observability.
- Experience working within highly available, cloud-native production environments.
- Experience supporting globally distributed engineering teams, preferably with APAC/JST time zone overlap.
📌 Site Reliability Engineer (SRE) – Observability (India)
🏢 Astek
📍 India