← CarrièresPoste ouvert

Ingénieur·e fiabilité de site

Temps pleinToronto / Télétravail (Canada)

Maintenir et améliorer la fiabilité, l’observabilité et la maturité opérationnelle des plateformes d’entreprise grâce à une discipline d’ingénierie systématique.

Aperçu du poste

Quix recherche une personne ingénieure en fiabilité de site qui aborde les problèmes opérationnels avec un état d’esprit d’ingénierie — construisant des systèmes, des outils et des processus qui préviennent les incidents plutôt que de seulement y réagir. Le rôle s’adresse à quelqu’un possédant une expérience approfondie de l’observabilité, de la gestion des incidents, de la planification de capacité et de l’ingénierie de la fiabilité dans des environnements distribués en production.

Ce que vous ferez

  • Définir et suivre des indicateurs de niveau de service et des objectifs de niveau de service pour les services de plateforme critiques.
  • Construire et maintenir une infrastructure d’observabilité : métriques, traçage distribué, journalisation structurée et alertes.
  • Diriger l’analyse post-incident et conduire des améliorations systématiques qui réduisent le temps moyen de récupération.
  • Établir des runbooks, des chemins d’escalade et des playbooks opérationnels pour les équipes de plateforme en production.
  • Mener la planification de capacité, les tests de charge et l’analyse des modes de défaillance pour identifier de façon proactive les risques de fiabilité.
  • Collaborer avec les équipes d’ingénierie sur les revues de préparation production, les barrières de déploiement et les exigences de fiabilité.
  • Identifier et réduire le travail répétitif par l’automatisation, les améliorations d’infrastructure et la refonte de processus.

Ce que nous recherchons

  • Expérience production substantielle dans un rôle de SRE, d’ingénierie de plateforme ou de fiabilité d’infrastructure.
  • Expertise approfondie de l’outillage d’observabilité : Prometheus, Grafana, Datadog, OpenTelemetry ou équivalents.
  • Expérience de la gestion de la fiabilité des systèmes distribués : équilibrage de charge, basculement, disjoncteurs et logique de réessai.
  • Solide expérience de la gestion des incidents : discipline de garde, analyse des causes racines et culture du post-mortem.
  • Maîtrise du scripting et de l’automatisation des tâches opérationnelles en Python, Bash ou Go.
  • Capacité à communiquer clairement les exigences et compromis de fiabilité aux équipes d’ingénierie et produit.

Atouts

  • Expérience des pratiques de chaos engineering et de l’outillage d’injection de défaillances.
  • Profil en gestion de SLO et de SLA dans des environnements de service d’entreprise ou réglementés.
  • Expérience des architectures de fiabilité multi-régions ou multi-clouds.
Impact du poste

La fiabilité de la plateforme n’est pas une considération secondaire — c’est un engagement fondamental envers les clients qui dépendent des systèmes Quix pour leur continuité opérationnelle. La fonction SRE protège cet engagement en construisant des systèmes qui échouent avec élégance, récupèrent rapidement et s’améliorent systématiquement, réduisant le risque opérationnel à chaque déploiement.

Postuler

Candidature pour Ingénieur·e fiabilité de site

Le poste est présélectionné. Le CV et le numéro mobile sont requis pour soutenir la vérification lorsque celle-ci sera connectée.

CV *
Postes liés

Autres occasions