03 Oct
|
Akkodis
|
Toronto
Manager, Site Reliability Engineering (SRE) Akkodis is seeking an experienced Manager, Site Reliability Engineering (SRE) to lead a team responsible for the reliability, availability, performance, and scalability of enterprise applications and platforms. The successful candidate will drive Site Reliability Engineering best practices, observability initiatives, automation, incident management, and continuous improvement across cloud and on-premises environments. This opportunity is ideal for a technical leader with strong experience in cloud operations, production support, automation, and people leadership.
Akkodis is seeking an experienced Manager, Site Reliability Engineering (SRE) to lead a team responsible for the reliability, availability, performance, and scalability of enterprise applications and platforms. The Manager, Site Reliability Engineering (SRE)'s primary responsibilities include, but are not limited to: Lead, mentor, and develop a team of Site Reliability Engineers. Drive reliability, availability, performance, and scalability across critical applications and platforms.
Oversee production support operations, on-call processes, incident management, and escalations. Partner with Development, Infrastructure, Security, and DevOps teams to improve service reliability. Lead major incident response activities and support problem management processes.
Develop operational standards, runbooks,
and knowledge management practices. Promote a culture of continuous improvement, collaboration, and operational excellence.
Site Reliability
Engineering (SRE) Observability & Monitoring Tools Production Support Operations 3+ years of experience leading technical teams. ~ Experience implementing Site Reliability Engineering practices. ~ Experience supporting mission-critical production environments. ~ Experience with incident response and problem management. ~ Solid stakeholder management and collaboration skills. Bachelor’s Degree in Computer Science, Software Engineering, or equivalent experience. Strong scripting or programming skills.
Experience with change management and compliance practices. Knowledge of SDLC and DevOps best practices.
Experience with disaster recovery and resiliency testing.
Technical Skills Site Reliability
Engineering (SRE) - Must Have DevOps Practices Strong leadership and coaching abilities Experience managing production support and operational teams. We foster a workplace where diversity is celebrated and every voice matters. SRE #SiteReliabilityEngineering #Azure #Kubernetes #CloudEngineering #EngineeringManager #DevOps #PlatformEngineering #Observability #Automation #InfrastructureAsCode #TorontoJobs #HybridJobs #TechnologyJobs #HiringNow #Akkodis #CloudOperations #ProductionSupport #LeadershipJobs #
📌 Site Reliability Engineering Manager (Toronto)
🏢 Akkodis
📍 Toronto