31 Aug
|
Info Way Solutions
|
Vancouver
31 Aug
Info Way Solutions
Vancouver
Site Reliability Engineering (SRE) Architect
Location: Vancouver, Canada
Role Overview
We are seeking an experienced Site Reliability Engineering (SRE) Architect to lead enterprise reliability transformation initiatives across large-scale cloud-native environments. The ideal candidate will have deep expertise in observability strategy, SLO governance, reliability engineering, operational excellence, and enterprise-scale SRE adoption. This role requires strong technical leadership to drive reliability frameworks, automation, resilience, and production readiness across mission-critical platforms.
Key Responsibilities
- Define and implement enterprise SLI, SLO, SLA, Error Budget, and Reliability Governance frameworks.
- Develop and execute enterprise observability strategies using platforms such as Dynatrace, OpenTelemetry, APM, Distributed Tracing, RUM, and Synthetic Monitoring.
- Design and implement highly available, resilient, and scalable cloud-native architectures.
- Lead initiatives around High Availability (HA), Disaster Recovery (DR), Resilience Engineering, and Business Continuity.
- Drive Incident Management, Problem Management, Root Cause Analysis (RCA), and Continuous Service Improvement practices.
- Lead automation initiatives focused on toil reduction, self-healing, auto-remediation, and operational excellence.
- Establish enterprise monitoring standards, governance models, and observability frameworks.
- Implement AIOps, predictive analytics, intelligent alerting, and event correlation capabilities.
- Support CI/CD, DevSecOps, GitOps, and Infrastructure as Code (IaC) adoption.
- Lead Production Readiness Reviews (PRR), Operational Readiness Reviews (ORR),
and reliability assessments.
- Collaborate with engineering, architecture, and business leadership to improve platform reliability and operational maturity.
- Drive enterprise-wide SRE transformation and reliability engineering adoption across large-scale environments.
Required Qualifications
- Extensive experience implementing SLI, SLO, SLA, Error Budget, and Reliability Governance frameworks.
- Strong expertise with Dynatrace and enterprise observability platforms including:
- Application Performance Monitoring (APM)
- Distributed Tracing
- Real User Monitoring (RUM)
- Synthetic Monitoring
- OpenTelemetry
- Strong experience with:
- Kubernetes
- Docker
- OpenShift
- Cloud-native architectures
- Experience designing:
- High Availability (HA)
- Disaster Recovery (DR)
- Resilience Engineering
- Business Continuity solutions
- Proven expertise in:
- Incident Management
- Problem Management
- Root Cause Analysis (RCA)
- Continuous Service Improvement
- Experience driving:
- Toil reduction
- Self-healing solutions
- Auto-remediation
- Operational automation
- Robust understanding of:
- Capacity Planning
- Performance Engineering
- Chaos Engineering
- Experience establishing enterprise observability strategies, governance, and monitoring standards.
- Familiarity with:
- AIOps
- Predictive Analytics
- Intelligent Alert Management
- Event Correlation
- Experience with:
- CI/CD
- DevSecOps
- GitOps
- Infrastructure as Code (IaC)
- Ability to lead:
- Production Readiness Reviews
- Operational Readiness Reviews
- Reliability Assessments
- Excellent stakeholder management and leadership skills with the ability to influence engineering, architecture, and business teams.
Preferred Qualifications
- Experience leading enterprise-wide SRE transformation initiatives.
- Proven expertise in developing enterprise observability strategies and reliability engineering adoption.
- Strong background in SLO governance and operational excellence programs.
- Relevant certifications in:
- Azure
- Kubernetes
- Dynatrace
- Site Reliability Engineering (SRE)
- DevOps
- Cloud Architecture
Key Skills
- Site Reliability Engineering (SRE)
- Enterprise SRE Transformation
- SLI / SLO / SLA
- Error Budget Management
- Reliability Governance
- Dynatrace
- OpenTelemetry
- APM
- Distributed Tracing
- Real User Monitoring (RUM)
- Synthetic Monitoring
- Kubernetes
- Docker
- OpenShift
- Cloud-Native Architecture
- High Availability (HA)
- Disaster Recovery (DR)
- Business Continuity
- Incident Management
- Problem Management
- Root Cause Analysis (RCA)
- Operational Excellence
- Toil Reduction
- Self-Healing
- Auto-Remediation
- Capacity Planning
- Performance Engineering
- Chaos Engineering
- Observability Strategy
- Monitoring Frameworks
- AIOps
- Predictive Analytics
- Event Correlation
- Intelligent Alerting
- CI/CD
- DevSecOps
- GitOps
- Infrastructure as Code (IaC)
📌 Site Reliability Engineering (SRE) Architect (Vancouver)
🏢 Info Way Solutions
📍 Vancouver