Promaynov Advisory Services Pvt. Ltd
Website:
promaynov.com
Job details:
Job Title : Assistant Manager - Azure Site Reliability Engineer (SRE)
Location : Bangalore
Exp. : 6-10 years
Role Summary : We are seeking an Azure Site Reliability Engineer (SRE) to drive platform reliability, observability,
automation, and operational excellence across enterprise cloud environments. The role focuses on
improving service availability, reducing operational risk, and enabling self-healing cloud platforms.
Key Responsibilities
- Define and implement Site Reliability Engineering practices.
- Establish and maintain SLIs, SLOs, and Error Budgets.
- Build monitoring and observability platforms using Azure Monitor, Grafana, Application
- Insights, and Log Analytics.
- Automate incident detection, diagnosis, and remediation.
- Lead root cause analysis (RCA) and post-incident reviews.
- Develop operational runbooks and self-healing automation.
- Improve platform resilience, availability, scalability, and disaster recovery readiness.
- Partner with engineering teams to improve production reliability.
- Drive platform operational governance and continuous improvement initiatives.
- Support major incident management and problem management activities.
Required Skills
- Azure Monitor
- Application Insights
- Log Analytics
- Grafana
- Kusto Query Language (KQL)
- Azure Automation
- PowerShell / Python
- Incident Management
- Reliability Engineering
- Performance Engineering
- Kubernetes
Preferred Skills
- AKS / Kubernetes
- Prometheus
- Open Telemetry
- Chaos Engineering
- DevSecOps
- Infrastructure as Code
Experience & Qualifications
- Bachelor's degree in Computer Science or Engineering.
- 6-10 years in Cloud Operations, Platform Engineering, or SRE roles.
- Strong experience in production support and reliability engineering.
- Experience supporting enterprise-scale Azure environments.
- Azure and Kubernetes certifications preferred.
Click on Apply to know more.