Site Reliability Engineering (SRE) Lead Role Summary Lead a cross-functional SRE team responsible for ensuring the reliability, availability, performance, and scalability of enterprise applications, infrastructure, and cloud platforms. Drive automation, observability, incident management, and continuous service improvement while enabling an end-to-end reliability engineering culture.
Key Responsibilities Own service reliability, availability, and operational excellence across platforms. Lead automation, self-healing, and observability initiatives. Drive major incident management, RCA, and blameless postmortems. Enable CI/CD, platform upgrades, patching, and continuous improvement. Lead and mentor SRE engineers while collaborating with application, infrastructure, cloud, and business teams. Act as the escalation point for reliability, monitoring, and autonomics platforms.