14 Aug
|
Simelabs - Digital, AI/ML, Automation, Robotics, Gen AI.
|
Kochi
14 Aug
Simelabs - Digital, AI/ML, Automation, Robotics, Gen AI.
Kochi
What You'll Do
- Design, implement, and maintain observability solutions using Datadog and related monitoring technologies.
- Configure and manage dashboards, alerts, APM, metrics, logs, and distributed tracing.
- Monitor and optimize Kubernetes-based, containerized, and microservices-driven applications.
- Integrate observability tools into AWS cloud environments and cloud-native services.
- Build and maintain API integrations to support monitoring and platform automation.
- Integrate observability into CI/CD pipelines to improve deployment visibility and operational insights.
- Automate monitoring, operational workflows, and repetitive tasks using Python and other scripting languages.
- Install, configure, and maintain Datadog agents, integrations, and secure platform configurations.
- Manage API keys, user roles, permissions, and access controls within observability platforms.
- Collaborate with engineering, DevOps, and infrastructure teams to improve platform reliability and performance.
- Lead proactive maintenance initiatives and continuous platform improvements to enhance scalability, stability, and operational efficiency.
- Troubleshoot production issues and implement long-term reliability improvements across distributed systems.
What You'll Need
- 5+ years of experience in Software Engineering, Site Reliability Engineering, or Platform Engineering.
- Robust proficiency in Python, JavaScript (Node.js), or Java.
- Hands-on experience designing, consuming,
and integrating RESTful APIs.
- Strong experience working with Kubernetes, including deployment, operations, and monitoring.
- Experience with Datadog (preferred) or similar observability platforms such as Prometheus and Grafana.
- Strong understanding of application performance monitoring (APM), logging, metrics, tracing, dashboards, and alerting.
- Experience monitoring containerized and microservices-based architectures.
- Hands-on experience with AWS cloud services and cloud-native infrastructure.
- Experience integrating observability platforms into AWS environments.
- Experience integrating monitoring and observability into CI/CD pipelines.
- Strong scripting and automation skills, with Python preferred.
- Demonstrated ownership of platform reliability, scalability, and performance improvements.
- Proven ability to lead maintenance activities and drive continuous operational enhancements.
- Strong communication and collaboration skills in distributed, cross-functional teams.
Nice to Have
- Experience owning and operating internal engineering platforms.
- Familiarity with Go (Golang).
- Experience with additional observability platforms such as New Relic, Dynatrace, Elastic, or Splunk Observability.
- Experience working within highly available, cloud-native production environments.
- Experience supporting globally distributed engineering teams, preferably with APAC/JST time zone overlap
📌 Site Reliability Engineer (SRE) – Observability (Kochi)
🏢 Simelabs - Digital, AI/ML, Automation, Robotics, Gen AI.
📍 Kochi