03 Sep
|
Info Way Solutions
|
Winnipeg
03 Sep
Info Way Solutions
Winnipeg
Site Reliability Engineering (SRE) Architect
Role Overview
We are seeking an experienced
Site Reliability Engineering (SRE) Architect
to lead enterprise reliability transformation initiatives across large-scale cloud-native environments. The ideal candidate will have deep expertise in observability strategy, SLO governance, reliability engineering, operational excellence, and enterprise-scale SRE adoption. This role requires strong technical leadership to drive reliability frameworks, automation, resilience, and production readiness across mission-critical platforms. Key Responsibilities
Define and implement enterprise
SLI, SLO, SLA, Error Budget, and Reliability Governance
frameworks. Develop and execute enterprise observability strategies using platforms such as
Dynatrace , OpenTelemetry, APM, Distributed Tracing, RUM, and Synthetic Monitoring. Design and implement highly available, resilient, and scalable cloud-native architectures. Lead initiatives around
High Availability (HA), Disaster Recovery (DR), Resilience Engineering, and Business Continuity . Drive Incident Management, Problem Management, Root Cause Analysis (RCA), and Continuous Service Improvement practices. Lead automation initiatives focused on
toil reduction, self-healing, auto-remediation, and operational excellence . Establish enterprise monitoring standards, governance models, and observability frameworks. Implement
AIOps , predictive analytics, intelligent alerting, and event correlation capabilities. Support CI/CD, DevSecOps, GitOps, and Infrastructure as Code (IaC) adoption. Lead Production Readiness Reviews (PRR), Operational Readiness Reviews (ORR), and reliability assessments.
Collaborate with engineering, architecture, and business leadership to improve platform reliability and operational maturity. Drive enterprise-wide
SRE transformation
and reliability engineering adoption across large-scale environments. Required Qualifications
Extensive experience implementing
SLI, SLO, SLA, Error Budget, and Reliability Governance
frameworks. Strong expertise with
Dynatrace
and enterprise observability platforms including: Application Performance Monitoring (APM) Real User Monitoring (RUM) Synthetic Monitoring OpenTelemetry Strong experience with: Docker OpenShift Cloud-native architectures High Availability (HA) Disaster Recovery (DR) Resilience Engineering Business Continuity solutions Root Cause Analysis (RCA) Experience driving: Toil reduction Self-healing solutions Auto-remediation Operational automation Solid understanding of: Capacity Planning Performance Engineering Experience establishing enterprise observability strategies, governance, and monitoring standards. Familiarity with: AIOps Predictive Analytics Event Correlation Experience with: CI/CD DevSecOps GitOps Infrastructure as Code (IaC) Ability to lead: Production Readiness Reviews Operational Readiness Reviews Reliability Assessments Excellent stakeholder management and leadership skills with the ability to influence engineering, architecture, and business teams. Preferred Qualifications
Experience leading enterprise-wide
SRE transformation initiatives . Proven expertise in developing enterprise observability strategies and reliability engineering adoption. Strong background in
SLO governance
and operational excellence programs.
#J-18808-Ljbffr
📌 Site Reliability Engineering (SRE) Architect (Winnipeg)
🏢 Info Way Solutions
📍 Winnipeg