- Design, implement, and maintain monitoring tools such as Dynatrace, Prometheus, Datadog, Grafana, AppDynamics, Splunk, and Apm Tools to ensure high availability and performance of software applications.
- Collaborate with cross-functional teams to identify areas for improvement in system reliability and develop strategies to mitigate issues.
- Develop automation scripts using Python or other languages to streamline tasks and improve efficiency.
Desired Candidate Profile
- 3-7 years of experience in Site Reliability Engineering (SRE) role with expertise in cloud computing platforms like AWS/Azure/GCP.
- Bachelor's degree in Any Specialization (B.Tech / B.E.).
- Solid understanding of monitoring tools such as Dynatrace, Prometheus, Datadog, Grafana; APM tools like AppDynamics; Log Analysis tools like Splunk; Automation Scripting languages like Python.