DevOps & Site reliability Engineer (Montreal)

DevOps & Site reliability Engineer (Montreal)

17 Sep
|
TMC Canada
|
Montreal

17 Sep

TMC Canada

Montreal

Note: French version below / La version française se trouve ci-dessous

About the Role

Join the Operations Technology team to design, automate, deploy, and support reliable application platforms and CI/CD capabilities. You'll work closely with development, infrastructure, network, security, and production support teams to improve software delivery, platform stability, and operational resilience. The role requires strong hands-on experience with Kubernetes, Docker/Podman, Linux, CI/CD pipelines, GitHub, Python, and shell scripting, along with a solid grasp of modern DevOps and SRE practices.

The ideal candidate is passionate about automation and reliability, and thrives on troubleshooting complex issues and driving continuous improvement.

Key Responsibilities

- Design, build, and maintain CI/CD pipelines and supporting deployment infrastructure
- Develop automated deployment solutions for Kubernetes and containerized environments, including Helm charts and YAML configurations
- Partner with development teams to improve build, test, and release processes
- Support deployments, configuration changes, and platform upgrades across environments
- Develop automation using Python and Linux shell scripting
- Manage GitHub repositories, branching strategies, and pull-request workflows
- Integrate automated testing, security scanning, and code-quality checks into CI/CD pipelines
- Troubleshoot application, container, Kubernetes, and network issues; investigate production incidents and implement corrective solutions
- Apply SRE principles to improve reliability, availability, and observability
- Define monitoring, alerting, and operational metrics
- Collaborate with infrastructure, network, database, security, and application teams
- Maintain technical documentation, runbooks, and troubleshooting guides
- Participate in design reviews, incident reviews, and an after-hours on-call rotation when required

Required Skills

- 5+ years of relevant experience in DevOps, SRE, platform, or infrastructure engineering
- Strong hands-on experience with Kubernetes (deployment, scaling, services, ingress, secrets)
- Strong experience with Docker/Podman and containerized environments
- Strong Linux/UNIX administration and shell scripting (Bash or KornShell)
- Hands-on automation experience with Python




- Strong understanding of CI/CD concepts and deployment strategies, with hands-on experience using tools like Jenkins and Artifactory
- Experience with Git/GitHub, including branching and release workflows
- Experience with YAML, Ansible, or equivalent automation frameworks
- Robust networking knowledge (DNS, TCP/IP, HTTP/HTTPS, TLS, proxies, load balancing)
- Understanding of SRE practices: monitoring, incident response, root-cause analysis
- Experience in Agile environments using tools like Jira
- Strong communication skills and ability to collaborate with globally distributed teams
- Ability to manage multiple priorities with limited supervision and participate in on-call rotation

_________________________

Ingénieur(e) DevOps, Kubernetes et fiabilité des systèmes (SRE)

À propos du poste

Rejoignez l'équipe Operations Technology pour concevoir, automatiser, déployer et soutenir des plateformes applicatives fiables ainsi que des capacités CI/CD. Vous collaborerez étroitement avec les équipes de développement, d'infrastructure, de réseau, de sécurité et de soutien à la production afin d'améliorer la livraison logicielle, la stabilité des plateformes et la résilience opérationnelle. Le rôle exige une solide expérience pratique avec Kubernetes, Docker/Podman, Linux, les pipelines CI/CD, GitHub, Python et le scripting shell, ainsi qu'une bonne compréhension des pratiques DevOps et SRE modernes.

Le/la candidat(e) idéal(e) est passionné(e) par l'automatisation et la fiabilité, et aime résoudre des problèmes complexes tout en favorisant l'amélioration continue.

Principales responsabilités

- Concevoir, construire et maintenir les pipelines CI/CD et l'infrastructure de déploiement
- Développer des solutions de déploiement automatisées pour Kubernetes et les environnements conteneurisés, incluant les Helm charts et configurations YAML
- Collaborer avec les équipes de développement pour améliorer les processus de build, test et livraison




- Soutenir les déploiements, changements de configuration et mises à niveau de plateforme
- Développer de l'automatisation avec Python et le scripting shell Linux
- Gérer les dépôts GitHub, les stratégies de branchement et les flux de pull requests
- Intégrer les tests automatisés, l'analyse de sécurité et les contrôles de qualité de code dans les pipelines CI/CD
- Dépanner les problèmes applicatifs, de conteneurs, Kubernetes et réseau; investiguer les incidents de production et mettre en œuvre des solutions correctives
- Appliquer les principes SRE pour améliorer la fiabilité, la disponibilité et l'observabilité
- Définir la surveillance, les alertes et les métriques opérationnelles
- Collaborer avec les équipes d'infrastructure, réseau, base de données, sécurité et applications
- Maintenir la documentation technique, les runbooks et les guides de dépannage
- Participer aux revues de conception, revues d'incidents et à la rotation de garde après les heures, au besoin

Compétences requises

- 5 ans et plus d'expérience pertinente en DevOps, SRE, ingénierie de plateforme ou d'infrastructure
- Solide expérience pratique avec Kubernetes (déploiement, mise à l'échelle, services, ingress, secrets)
- Solide expérience avec Docker/Podman et les environnements conteneurisés
- Solides compétences en administration Linux/UNIX et en scripting shell (Bash ou KornShell)
- Expérience pratique en automatisation avec Python
- Solide compréhension des concepts CI/CD et des stratégies de déploiement, avec expérience pratique d'outils comme Jenkins et Artifactory
- Expérience avec Git/GitHub, incluant les stratégies de branchement et de livraison
- Expérience avec YAML, Ansible ou frameworks d'automatisation équivalents
- Solides connaissances réseau (DNS, TCP/IP, HTTP/HTTPS, TLS, proxys, équilibrage de charge)
- Compréhension des pratiques SRE : surveillance, réponse aux incidents, analyse des causes profondes
- Expérience en environnement Agile avec des outils comme Jira
- Solides compétences en communication et capacité à collaborer avec des équipes réparties mondialement
- Capacité à gérer plusieurs priorités avec supervision limitée et à participer à la rotation de garde

📌 DevOps & Site reliability Engineer (Montreal)
🏢 TMC Canada
📍 Montreal

Reply to this offer

Impress this employer describing Your skills and abilities, fill out the form below and leave Your personal touch in the presentation letter.

Subscribe to this job alert:

Get the latest job offers by email for: devops & site reliability engineer (montreal) / montreal

Subscribe to this job alert:

Get the latest job offers by email for: devops & site reliability engineer (montreal) / montreal