12 Aug
|
Newforma
|
Quebec City
12 Aug
Newforma
Quebec City
Nous sommes à la recherche d'un(e) Développeur(se) de plateforme de données talentueux(se) pour se joindre à notre équipe d'ingénierie de plateforme et concevoir les fondations de données qui alimenteront la prochaine génération de capacités d'intelligence artificielle et d'analytique chez Newforma.
Dans ce rôle, vous concevrez et mettrez en œuvre des architectures de données modernes, notamment des architectures de type médaillon (bronze, argent, or) et lakehouse, développerez des pipelines de données pilotés par les événements capables de traiter en temps réel des milliards de documents et de communications liées aux projets, et créerez l'infrastructure analytique qui soutient à la fois les initiatives de veille stratégique (Business Intelligence) et d'IA/apprentissage automatique (AI/ML).
Il s'agit d'un rôle clé à un moment particulièrement stimulant pour l'entreprise. Alors que nous poursuivons notre migration vers AWS et investissons massivement dans l'intelligence artificielle, vous contribuerez à établir les pratiques et les infrastructures de données qui soutiendront la croissance de l'entreprise pour les années à venir.
Newforma gère des milliards de courriels, documents, demandes d'information (RFI), soumissions, plans et fichiers de projets pour des milliers de chantiers de construction partout dans le monde. Cet significant volume de données représente une occasion exceptionnelle de générer des insights alimentés par l'IA, d'automatiser intelligemment les processus et de développer des capacités analytiques avancées.
Vous bâtirez l'infrastructure de données permettant de libérer ce potentiel en créant des pipelines transformant les données brutes des projets en ensembles de données propres, structurés et prêts pour l'IA, tout en soutenant l'analytique en temps réel et la veille stratégique. En étroite collaboration avec notre directeur de l'ingénierie IA et l'équipe d'ingénierie de plateforme, vous mettrez en place des modèles d'architecture de données qui supporteront notamment la recherche sémantique, les systèmes RAG (Retrieval-Augmented Generation), les tableaux de bord exécutifs et l'analytique prédictive.
Dans ce rôle, vos responsabilités comprendront :Architecture et stratégie de données
Concevoir et mettre en œuvre des architectures de type médaillon (couches bronze, argent et or) ou des architectures lakehouse sur AWS afin d'organiser et transformer les données à grande échelle.
Établir des normes de modélisation des données, des pratiques de gouvernance et des cadres d'assurance qualité à l'échelle de l'organisation.
Définir les politiques de rétention, d'archivage et de gestion du cycle de vie des données pour de très grands volumes de données de projets.
Créer des architectures de référence et des meilleures pratiques en ingénierie des données pour les différentes équipes.
Collaborer avec le directeur de l'ingénierie IA afin de concevoir des pipelines optimisés pour les charges de travail AI/ML, incluant les embeddings vectoriels et l'entraînement des modèles.
Travailler avec l'architecte logiciel principal afin d'assurer l'alignement de l'architecture de données avec la stratégie globale de la plateforme.
Concevoir des schémas et structures de données répondant aux besoins analytiques et aux applications d'intelligence artificielle.
Architecture pilotée par les événements (Event-Driven)
Concevoir et mettre en œuvre des architectures de données orientées événements à l'aide d'AWS EventBridge, Kinesis, MSK (Kafka), SNS et SQS.
Développer des pipelines de diffusion de données en temps réel permettant de capturer, traiter et acheminer les événements des projets à travers la plateforme.
Définir les schémas et modèles d'événements pour les domaines d'affaires (téléversements de documents, classement de courriels, soumissions de RFI, etc.).
Mettre en œuvre des mécanismes de capture des changements de données (CDC) afin de diffuser les modifications des bases de données vers les lacs de données et plateformes analytiques.
Concevoir des flux de travail déclenchés par les événements afin d'alimenter les processus d'IA, les notifications et les mises à jour des systèmes en aval.
Établir des pratiques de gouvernance des événements incluant le versionnage, la documentation et la surveillance.
Optimiser le traitement des événements afin d'assurer une faible latence et un haut débit à grande échelle.
Développement de pipelines de données
Concevoir des pipelines ETL/ELT robustes et évolutifs à l'aide d'AWS Glue, Step Functions, Lambda et EMR.
Développer des traitements de transformation permettant de nettoyer, enrichir et structurer des données de projets non structurées.
Mettre en place des contrôles de qualité, des règles de validation et des mécanismes de surveillance tout au long des pipelines.
Créer des composantes et des cadres de développement réutilisables par les différentes équipes.
Optimiser la performance et les coûts liés au traitement de milliards de documents.
Gérer divers formats de données tels que les courriels, PDF, dessins CAD, images et bases de données structurées.
Assurer la traçabilité des données (data lineage) ainsi que la gestion des métadonnées.
Analytique et intelligence d'affaires
Concevoir et développer des entrepôts de données (data warehouses) et des magasins de données (data marts) à l'aide d'Amazon Redshift, Athena ou technologies similaires.
Créer des modèles dimensionnels et des schémas en étoile optimisés pour l'analyse de données.
Construire des jeux de données et des agrégations alimentant les tableaux de bord exécutifs et les rapports opérationnels.
Déployer des solutions de BI à l'aide d'outils tels que QuickSight, Tableau, Power BI ou équivalents.
Collaborer avec les équipes produit et affaires afin de comprendre leurs besoins analytiques et fournir des informations exploitables.
Développer des capacités analytiques en libre-service permettant aux équipes d'explorer les données de façon autonome.
Définir les indicateurs clés de performance (KPI), les métriques et les cadres de mesure pour l'analyse produit et d'affaires.
Infrastructure de données pour l'IA et l'apprentissage automatique
Préparer et structurer les données afin de soutenir des initiatives d'IA comme la classification de documents, la recherche sémantique et les agents intelligents.
Développer des pipelines de génération et de stockage d'embeddings vectoriels pour les systèmes RAG.
Créer des jeux de données d'entraînement et des feature stores pour les modèles d'apprentissage automatique.
Mettre en œuvre des mécanismes de versionnage des données et de suivi des expérimentations AI/ML.
Concevoir des pipelines d'inférence évolutifs alimentant les modèles d'IA avec des données fraîches et contextualisées.
Collaborer avec l'équipe d'ingénierie IA afin d'optimiser les formats de données et les modèles d'accès pour les applications basées sur les grands modèles de langage (LLM).
Exploitation et surveillance des données
Déployer des solutions complètes de surveillance, d'alerte et d'observabilité pour les pipelines et systèmes de données.
Développer des tableaux de bord de qualité des données et des mécanismes de détection d'anomalies.
Produire la documentation opérationnelle et les procédures de support pour les composantes de la plateforme de données.
Optimiser les coûts liés au stockage,
au traitement et aux requêtes de données.
Assurer la sécurité, le chiffrement et la conformité aux réglementations sur la protection des données.
Participer à la rotation de garde (on-call) pour soutenir les systèmes de données en production.
Collaboration
Collaborer avec les autres membres de l'équipe d'ingénierie de plateforme à la réalisation des objectifs communs.
Participer aux cérémonies Agile, incluant les réunions quotidiennes, la planification des sprints et les rétrospectives.
Travailler étroitement avec les équipes de développement et l'architecte logiciel afin de promouvoir de solides pratiques d'ingénierie des données dans les nouvelles fonctionnalités.
Exigences du poste
Minimum de 5 années d'expérience en ingénierie des données, en analytique de données ou dans un domaine connexe.
Expérience pratique approfondie avec les services de données AWS, notamment S3, Glue, Athena, Redshift, Kinesis, EventBridge, Lambda et EMR.
Expertise démontrée dans la conception et l'implantation d'architectures pilotées par les événements utilisant des technologies telles que Kafka/MSK, Kinesis et EventBridge.
Expérience dans la mise en place d'architectures médaillon, de plateformes lakehouse ou d'autres architectures de données modernes similaires (bronze/argent/or, Delta Lake, Iceberg).
Excellente maîtrise du SQL et de la conception de bases de données relationnelles (PostgreSQL, MySQL) et analytiques (Redshift, Snowflake).
Solides compétences en programmation Python appliquées au traitement, à la transformation et à l'automatisation des données.
Expérience avec des outils d'orchestration de données tels qu'Apache Airflow, AWS Step Functions ou Prefect.
Connaissance des techniques de modélisation de données, notamment les modèles dimensionnels, schémas en étoile et Data Vault.
Expérience avec les outils d'analytique et de BI (QuickSight, Tableau, Power BI, Looker) ainsi que la création de tableaux de bord et de rapports.
Bonne compréhension des principes de qualité des données, de gouvernance et de gestion des données maîtres (Master Data Management).
Familiarité avec les approches d'infrastructure comme code (Pulumi, Terraform, CloudFormation).
Grande capacité d'analyse et de résolution de problèmes complexes.
Excellentes habiletés de communication et aptitude à vulgariser des concepts techniques auprès de différents publics.
Esprit collaboratif et capacité à travailler efficacement avec les équipes d'ingénierie, de produit et d'affaires.
Bilinguisme français-anglais.
Atouts recherchés
Certifications AWS (AWS Data Analytics Specialty, AWS Solutions Architect ou équivalent).
Expérience avec les services de données Azure (Data Factory, Synapse, Event Hubs) et les migrations Azure vers AWS.
Connaissance des technologies de traitement de flux en temps réel (Apache Spark Streaming, Flink, Kafka Streams).
Expérience dans la préparation de données pour les applications AI/ML, incluant les bases de données vectorielles (Pinecone, Weaviate, pgvector).
Connaissance du traitement documentaire, de l'OCR et de l'extraction de données non structurées.
Expérience avec les solutions de catalogage de données et de gestion de métadonnées (AWS Glue Data Catalog, Alation, Collibra).
Connaissance de .NET/C# et de l'intégration de pipelines de données avec des applications .NET.
Compréhension des architectures SaaS multi-locataires (multi-tenancy).
Connaissance des cadres réglementaires en matière de confidentialité et de conformité (RGPD, SOC 2, CCPA).
Expérience dans l'industrie de l'architecture, de l'ingénierie, de la construction (AECO) ou de la gestion de projets.
Familiarité avec les bases de données graphe (Neptune, Neo4j).
Expérience avec les architectures de données serverless et les stratégies d'optimisation des coûts.
Connaissance de dbt (Data Build Tool) ou d'outils similaires de transformation de données.
📌 Data platform Developer (Quebec City)
🏢 Newforma
📍 Quebec City