20 Aug
|
KPMG
|
Bengaluru
Req#30048807
We are seeking an Azure Site Reliability Engineer (SRE) to drive platform reliability, observability, automation, and operational excellence across enterprise cloud environments. The role focuses on improving service availability, reducing operational risk, and enabling self-healing cloud platforms.
Key Responsibilities
•Define and implement Site Reliability Engineering practices.
•Establish and maintain SLIs, SLOs, and Error Budgets.
•Build monitoring and observability platforms using Azure Monitor, Grafana, Application Insights, and Log Analytics.
•Automate incident detection, diagnosis, and remediation.
•Lead root cause analysis (RCA) and post-incident reviews.
•Develop operational runbooks and self-healing automation.
•Improve platform resilience, availability, scalability, and disaster recovery readiness.
•Partner with engineering teams to improve production reliability.
•Drive platform operational governance and continuous improvement initiatives.
•Support major incident management and problem management activities.
Required Skills
•Azure Monitor
•Application Insights
•Log Analytics
•Grafana
•Kusto Query Language (KQL)
•Azure Automation
•PowerShell / Python
•Incident Management
•Reliability Engineering
•Performance Engineering
Preferred Skills
•AKS / Kubernetes
•Prometheus
•OpenTelemetry
•Chaos Engineering
•DevSecOps
•Infrastructure as Code
📌 Assistant Manager (Bengaluru)
🏢 KPMG
📍 Bengaluru