Ingénieur(e) IA Générative - Hébergement De Modèles LLM
Teknik, data och digitalt · Data, AI och analys · Maskininlärning · Artificiell intelligens · Mjukvaruutveckling
I korthet
Ericsson recherche un(e) Ingénieur(e) IA Générative pour concevoir et opérer l'infrastructure GPU dédiée à l'entraînement et à l'inférence de modèles LLM à Montréal. Ce rôle implique la mise en œuvre de la plateforme Ray, l'optimisation des services de modèles, et l'application des pratiques SRE/SecOps.
Ansvarsområden
- Concevoir, déployer et exploiter l'infrastructure de clusters GPU pour l'entraînement et l'inférence.
- Définir l'architecture et piloter la mise en œuvre de la plateforme basée sur Ray et les intégrations NVIDIA.
- Développer et maintenir les couches de service des modèles et les API (points de terminaison compatibles OpenAI).
- Créer et administrer un environnement d'hébergement et un catalogue de modèles sécurisés.
- Mettre en place des environnements d'exécution pour plateformes d'agents et API développeurs associées.
- Façonner l'expérience développeur (CLI, SDK, modèles de projets).
- Intégrer la plateforme aux pipelines MLOps, catalogues de jeux de données/versions, traçabilité et gouvernance, et observabilité.
- Appliquer les exigences SRE/SecOps : gestion des incidents, guides d'exploitation, métrologie/alerte, tests de chaos, dimensionnement prédictif.
- Évoluer avec aisance dans des environnements multi-technologies et multi-plateformes IT.
- Collaborer avec les équipes d'ingénierie des données, de sécurité, juridiques et produit pour garantir la conformité et l'éthique.
- Mentorat technique, animation des revues de conception et contribution à la feuille de route stratégique et aux cahiers d'exploitation.
Krav
- Solide expérience en production dans la conception et l'exploitation de clusters GPU et de charges de travail ML distribuées.
- Pratique concrète de Ray ou de cadres de calcul distribué équivalents ; maîtrise attendue de la suite NVIDIA AI (Triton, CUDA, NCCL).
- Expérience probante dans le développement de services d'inférence et d'API pour modèles (compatibles OpenAI ou propriétaires).
- Connaissance approfondie de la conteneurisation et de l'orchestration : Docker, Kubernetes, Helm ; expérience opérationnelle des charges GPU sur Kubernetes.
- Maîtrise des techniques d'optimisation de modèles : quantification, élagage, parallélisme de tenseurs, parallélisme de pipeline, précision mixte.
- Solides compétences en ingénierie système et réseau (stockage/E-S, interconnexions GPU, optimisation RDMA/NCCL) et maîtrise des primitives d'entraînement distribué.
- Compétences affirmées en développement logiciel dans au moins deux des langages suivants : Python, Go ou C++ ; expérience dans le développement d'outils CLI et de SDK.
- Pratique des architectures d'observabilité et de télémétrie (Prometheus, Grafana, ELK/EFK, OpenTelemetry) ainsi que du suivi analytique des coûts et des consommations.
- Maîtrise des principes de sécurité et d'isolation pour environnements multi-locataires, de la gestion des secrets et du contrôle d'accès.
- Expérience avérée dans la conduite de services critiques en production (SLO/SLI/SLA), la gestion d'incidents et la planification capacitaire.
- Excellentes capacités de communication et de travail en équipe interdisciplinaire (infrastructure, data, ML, produit).
- Bilinguisme français et anglais requis.
Önskade kvalifikationer
- Expérience dans la conception de _marketplaces_ de modèles, la mise en place de systèmes de facturation ou la gestion de quotas et facturations multi-locataires.
- Pratique des frameworks d'agents autonomes (_agentic frameworks_), des pipelines RLHF ou des couches d'orchestration pour le raisonnement multi-tours (_multi-turn reasoning_).
- Connaissance des frameworks spécialisés dans le service d'inférence : Triton, KServe, TorchServe.
- Expérience pratique de la virtualisation GPU (MIG), des ordonnanceurs Kubernetes et des problématiques d'approvisionnement matériel ou micrologiciel (_firmware_).
- Maîtrise de l'intégration des passerelles API compatibles OpenAI, de la limitation de débit (_rate limiting_), de la gestion de versions des modèles et des stratégies de déploiement A/B.
- Connaissance approfondie des exigences réglementaires liées aux modèles d'IA (résidence des données, contrôles à l'exportation).
Förmåner
- Possibilité d'une prime annuelle basée sur la performance de l'entreprise et individuelle.
- Choix de 3 options de régime médical et dentaire, avec couverture de base financée par Ericsson.
- Contribution automatique de 2% de l'entreprise au régime de retraite.
- Correspondance de 50% de la contribution de l'employé au Régime d'épargne-retraite enregistré, jusqu'à 8% de la contribution de l'employé (maximum de 4% de contrepartie).
- Assurance vie de base et couverture pour décès accidentel et mutilation (deux fois le salaire de base annuel) sans frais.
- Couverture pour invalidité de courte durée.
- Possibilité de participer au plan d'achat d'actions d'Ericsson.
- Minimum de 18 jours de congés accumulés, plus au moins 3 jours personnels.
- Minimum de 10 jours fériés, 1 jour de bénévolat et des jours de maladie.
- Jusqu'à 10 semaines de congé de maternité payé.
- 6 semaines de congé parental ou d'adoption à 100% du salaire.
- Programmes de bien-être financier.
- Aide éducative.
- Cadeaux jumelés.
- Compte bien-être.
- Programmes de reconnaissance.
#IA Générative#LLM#GPU#MLOps#SRE#SecOps#Kubernetes