Ingénieur(e) Site Reliability (SRE)

Ingénieur(e) Site Reliability (SRE)

30 Jul
|
MANTU GROUP
|
Toronto

30 Jul

MANTU GROUP

Toronto

Nous recherchons un(e) Ingénieur(e) Site Reliability (SRE) expérimenté(e) pour soutenir des plateformes de cybersécurité, de gestion des risques liés aux données et de résilience, en garantissant leur fiabilité, disponibilité, performance et visibilité opérationnelle . La personne retenue jouera un rôle clé dans le maintien de la stabilité des environnements de production, l’amélioration de l’observabilité, le soutien à la réponse aux incidents et la fourniture de tableaux de bord et d’analyses opérationnelles destinés aux équipes d’ingénierie, d’exploitation, de gestion des risques et à la direction.

Lieu et mode de travail

Lieu : Télétravail partout au Canada

Mode de travail : 100 % à distance

Principales responsabilités

Maintenir et améliorer la fiabilité, la disponibilité, l’évolutivité et la performance des plateformes de cybersécurité et de l’infrastructure associée.

Surveiller l’état de santé des systèmes, identifier les risques opérationnels, répondre aux incidents et assurer une résolution rapide des problèmes ayant un impact sur les services.

Instrumenter l’infrastructure, les applications, les API, les pipelines de données, les bases de données et les services cloud afin d’assurer une visibilité opérationnelle de bout en bout .

Concevoir, mettre en œuvre et améliorer les solutions de surveillance, d’alerting, de journalisation, de traçage et d’observabilité dans des environnements distribués et cloud natifs.

Développer des alertes pertinentes et exploitables afin de réduire le bruit et d’améliorer la qualité du signal pour une détection et une réponse plus rapides.

Définir et suivre les indicateurs de fiabilité, notamment les SLI, SLO, SLA, budgets d’erreur, la latence, le débit, les taux d’erreur et les métriques de saturation .

Créer et maintenir des tableaux de bord pour les équipes d’ingénierie, d’exploitation, produit, gestion des risques et pour les parties prenantes exécutives.

Améliorer continuellement les tableaux de bord exécutifs afin de soutenir les revues de direction sur la santé des services, les tendances d’incidents, les risques opérationnels et les performances de fiabilité.

Collaborer avec les équipes d’ingénierie, d’infrastructure, cloud et cybersécurité pour identifier les lacunes de fiabilité et mettre en œuvre des améliorations durables.

Participer à la réponse aux incidents, à l’analyse des causes racines, aux revues post-incident et aux activités de gestion des problèmes .

Automatiser les tâches opérationnelles, les vérifications de santé,



la validation des déploiements, les rapports et les procédures de reprise.

Soutenir les processus CI/CD, DevOps et de gestion des mises en production en validant la préparation opérationnelle, la couverture de surveillance, les plans de retour arrière et les exigences de support de production.

Contribuer aux initiatives d’ingénierie de résilience, notamment la planification de capacité, l’optimisation des performances, les tests de bascule, la préparation à la reprise après sinistre et les tests de résilience .

Veiller à ce que les processus opérationnels et les pratiques d’observabilité soient conformes aux normes de sécurité, de gestion des risques, de conformité et de gouvernance de l’entreprise.

Qualifications requises

10 ans ou plus d’expérience en Site Reliability Engineering, DevOps, ingénierie systèmes, ingénierie d’infrastructure, développement logiciel ou exploitation de production .

Solide expérience du support de plateformes hautement disponibles, distribuées, cloud ou critiques pour l’entreprise .

Expertise pratique des domaines de la surveillance, des alertes, de la journalisation, des métriques, du traçage, des tableaux de bord et de l’observabilité .

Expérience dans l’instrumentation d’applications, de services, d’API, de bases de données, d’infrastructures et de composants cloud.

Bonne compréhension des concepts de SLI, SLO, SLA, budgets d’erreur, gestion des incidents, gestion de capacité et préparation opérationnelle .

Expérience démontrée dans la conception d’alertes exploitables et dans le soutien à la détection et à la résolution rapides des incidents.

Expérience de la création de tableaux de bord opérationnels pour des équipes techniques et des parties prenantes exécutives.

Excellentes compétences en programmation ou scripting avec Python, Bash, PowerShell, Java ou des langages similaires .

Expérience avec AWS, Azure ou GCP .

Expérience avec les outils Infrastructure as Code tels que Terraform ou équivalent.

Bonne connaissance des pipelines CI/CD, des pratiques DevOps, des processus de mise en production et des modèles de support de production .

Solides compétences en résolution de problèmes dans des environnements distribués,



avec des API REST, des plateformes de messagerie et des intégrations de services .

Connaissance de PostgreSQL, MSSQL, MongoDB ou d’autres bases de données relationnelles et non relationnelles.

Excellentes compétences en communication écrite et orale, avec la capacité d’expliquer des sujets techniques à des publics non techniques et exécutifs .

Atouts appréciés

Expérience du support de plateformes de cybersécurité, de gestion des risques, de résilience, de conformité ou de sécurité d’entreprise .

Expérience avec des outils d’observabilité tels que Splunk, Grafana, Prometheus, Datadog, Dynatrace, Recent Relic, Azure Monitor, CloudWatch ou OpenTelemetry .

Expérience de la création de tableaux de bord exécutifs sur la santé des services, de scorecards de fiabilité, de rapports de risques opérationnels et de tendances d’incidents .

Expérience du développement de vérifications de santé automatisées, de surveillance synthétique, de cartographies de dépendances et de runbooks opérationnels .

Expérience avec Kubernetes, Docker, les services serverless et les environnements cloud natifs .

Familiarité avec Apache Kafka et les plateformes de messagerie distribuée.

Connaissance des outils de gouvernance et de sécurité cloud ainsi que des solutions CSPM telles que Wiz, Prisma ou CloudGuard .

Expérience du suivi opérationnel de services d’IA dans le cloud (Azure AI, AWS Bedrock, Google Vertex AI).

- Expérience du support d’environnements Linux et Windows via le scripting, l’automatisation, la surveillance et le dépannage.

Pourquoi nous rejoindre ?

Une communauté internationale réunissant plus de 110 nationalités différentes .

Un environnement où la confiance est au cœur de nos valeurs : 70 % de nos dirigeants ont commencé leur carrière à un poste de niveau débutant .

Un système de formation solide grâce à notre Académie interne et à plus de 250 modules de formation disponibles .

Un environnement de travail dynamique qui se retrouve régulièrement lors d’ événements internes (afterworks, team buildings, etc.).

Amaris Consulting promeut l’égalité des chances. Nous nous engageons à rassembler des personnes issues de parcours divers et à créer un environnement de travail inclusif. À ce titre, nous accueillons les candidatures de toutes les personnes qualifiées, sans distinction de sexe, d’orientation sexuelle, de race, d’origine ethnique, de croyances, d’âge, de situation matrimoniale, de handicap ou de toute autre caractéristique.

#J-18808-Ljbffr

📌 Ingénieur(e) Site Reliability (SRE)
🏢 MANTU GROUP
📍 Toronto

Reply to this offer

Impress this employer describing Your skills and abilities, fill out the form below and leave Your personal touch in the presentation letter.

Subscribe to this job alert:

Get the latest job offers by email for: ingénieur(e) site reliability (sre) / toronto

Subscribe to this job alert:

Get the latest job offers by email for: ingénieur(e) site reliability (sre) / toronto