We are looking for an experienced Observability SME Site Reliability Engineer who will drive endtoend observability strategy monitoring automation and reliability engineering across a hybrid environment Azure OnPrem The ideal candidate must have deep expertise in Datadog administration and configuration handson experience in Azure services and strong automation skills using Terraform GitHub Actions and PowerShell
This role will be responsible for designing observability standards implementing automated monitoring deployments ensuring platform reliability and enabling proactive incident detection remediation
Key Responsibilities
Observability Datadog Primary Focus
Act as the Subject Matter Expert SME for Datadog owning platform administration configurations access control and best practices
Design implement and maintain observability standards across applications infrastructure APIs and data platforms
Automate Datadog agent deployment configurations dashboards alerts synthetics log pipelines and APM instrumentation using
Terraform
GitHub Actions
Set up and optimize monitoring for Azure services including but not limited to