Site Reliability Engineering (SRE) Architect (Vancouver)

Site Reliability Engineering (SRE) Architect (Vancouver)

31 Aug
|
Info Way Solutions
|
Vancouver

31 Aug

Info Way Solutions

Vancouver

Site Reliability Engineering (SRE) Architect

Location: Vancouver, Canada

Role Overview

We are seeking an experienced Site Reliability Engineering (SRE) Architect to lead enterprise reliability transformation initiatives across large-scale cloud-native environments. The ideal candidate will have deep expertise in observability strategy, SLO governance, reliability engineering, operational excellence, and enterprise-scale SRE adoption. This role requires strong technical leadership to drive reliability frameworks, automation, resilience, and production readiness across mission-critical platforms.

Key Responsibilities

- Define and implement enterprise SLI, SLO, SLA, Error Budget, and Reliability Governance frameworks.
- Develop and execute enterprise observability strategies using platforms such as Dynatrace, OpenTelemetry, APM, Distributed Tracing, RUM, and Synthetic Monitoring.
- Design and implement highly available, resilient, and scalable cloud-native architectures.
- Lead initiatives around High Availability (HA), Disaster Recovery (DR), Resilience Engineering, and Business Continuity.
- Drive Incident Management, Problem Management, Root Cause Analysis (RCA), and Continuous Service Improvement practices.
- Lead automation initiatives focused on toil reduction, self-healing, auto-remediation, and operational excellence.
- Establish enterprise monitoring standards, governance models, and observability frameworks.
- Implement AIOps, predictive analytics, intelligent alerting, and event correlation capabilities.
- Support CI/CD, DevSecOps, GitOps, and Infrastructure as Code (IaC) adoption.
- Lead Production Readiness Reviews (PRR), Operational Readiness Reviews (ORR),



and reliability assessments.
- Collaborate with engineering, architecture, and business leadership to improve platform reliability and operational maturity.
- Drive enterprise-wide SRE transformation and reliability engineering adoption across large-scale environments.

Required Qualifications

- Extensive experience implementing SLI, SLO, SLA, Error Budget, and Reliability Governance frameworks.
- Strong expertise with Dynatrace and enterprise observability platforms including:
- Application Performance Monitoring (APM)
- Distributed Tracing
- Real User Monitoring (RUM)
- Synthetic Monitoring
- OpenTelemetry
- Strong experience with:
- Kubernetes
- Docker
- OpenShift
- Cloud-native architectures
- Experience designing:
- High Availability (HA)
- Disaster Recovery (DR)
- Resilience Engineering
- Business Continuity solutions
- Proven expertise in:
- Incident Management
- Problem Management
- Root Cause Analysis (RCA)
- Continuous Service Improvement
- Experience driving:
- Toil reduction
- Self-healing solutions
- Auto-remediation
- Operational automation
- Robust understanding of:
- Capacity Planning
- Performance Engineering
- Chaos Engineering
- Experience establishing enterprise observability strategies, governance, and monitoring standards.
- Familiarity with:
- AIOps




- Predictive Analytics
- Intelligent Alert Management
- Event Correlation
- Experience with:
- CI/CD
- DevSecOps
- GitOps
- Infrastructure as Code (IaC)
- Ability to lead:
- Production Readiness Reviews
- Operational Readiness Reviews
- Reliability Assessments
- Excellent stakeholder management and leadership skills with the ability to influence engineering, architecture, and business teams.

Preferred Qualifications

- Experience leading enterprise-wide SRE transformation initiatives.
- Proven expertise in developing enterprise observability strategies and reliability engineering adoption.
- Strong background in SLO governance and operational excellence programs.
- Relevant certifications in:
- Azure
- Kubernetes
- Dynatrace
- Site Reliability Engineering (SRE)
- DevOps
- Cloud Architecture

Key Skills

- Site Reliability Engineering (SRE)
- Enterprise SRE Transformation
- SLI / SLO / SLA
- Error Budget Management
- Reliability Governance
- Dynatrace
- OpenTelemetry
- APM
- Distributed Tracing
- Real User Monitoring (RUM)
- Synthetic Monitoring
- Kubernetes
- Docker
- OpenShift
- Cloud-Native Architecture
- High Availability (HA)
- Disaster Recovery (DR)
- Business Continuity
- Incident Management
- Problem Management
- Root Cause Analysis (RCA)
- Operational Excellence
- Toil Reduction
- Self-Healing
- Auto-Remediation
- Capacity Planning
- Performance Engineering
- Chaos Engineering
- Observability Strategy
- Monitoring Frameworks
- AIOps
- Predictive Analytics
- Event Correlation
- Intelligent Alerting
- CI/CD
- DevSecOps
- GitOps
- Infrastructure as Code (IaC)

📌 Site Reliability Engineering (SRE) Architect (Vancouver)
🏢 Info Way Solutions
📍 Vancouver

Reply to this offer

Impress this employer describing Your skills and abilities, fill out the form below and leave Your personal touch in the presentation letter.

Subscribe to this job alert:

Get the latest job offers by email for: site reliability engineering (sre) architect (vancouver) / vancouver

Subscribe to this job alert:

Get the latest job offers by email for: site reliability engineering (sre) architect (vancouver) / vancouver