Ingénieur(e) IA Générative - Hébergement De Modèles LLM

Teknik, data och digitalt · Data, AI och analys · Maskininlärning · Artificiell intelligens · Mjukvaruutveckling

I korthet

Ericsson recherche un(e) Ingénieur(e) IA Générative pour concevoir et opérer l'infrastructure GPU dédiée à l'entraînement et à l'inférence de modèles LLM à Montréal. Ce rôle implique la mise en œuvre de la plateforme Ray, l'optimisation des services de modèles, et l'application des pratiques SRE/SecOps.

Ansvarsområden

  • Concevoir, déployer et exploiter l'infrastructure de clusters GPU pour l'entraînement et l'inférence.
  • Définir l'architecture et piloter la mise en œuvre de la plateforme basée sur Ray et les intégrations NVIDIA.
  • Développer et maintenir les couches de service des modèles et les API (points de terminaison compatibles OpenAI).
  • Créer et administrer un environnement d'hébergement et un catalogue de modèles sécurisés.
  • Mettre en place des environnements d'exécution pour plateformes d'agents et API développeurs associées.
  • Façonner l'expérience développeur (CLI, SDK, modèles de projets).
  • Intégrer la plateforme aux pipelines MLOps, catalogues de jeux de données/versions, traçabilité et gouvernance, et observabilité.
  • Appliquer les exigences SRE/SecOps : gestion des incidents, guides d'exploitation, métrologie/alerte, tests de chaos, dimensionnement prédictif.
  • Évoluer avec aisance dans des environnements multi-technologies et multi-plateformes IT.
  • Collaborer avec les équipes d'ingénierie des données, de sécurité, juridiques et produit pour garantir la conformité et l'éthique.
  • Mentorat technique, animation des revues de conception et contribution à la feuille de route stratégique et aux cahiers d'exploitation.

Krav

  • Solide expérience en production dans la conception et l'exploitation de clusters GPU et de charges de travail ML distribuées.
  • Pratique concrète de Ray ou de cadres de calcul distribué équivalents ; maîtrise attendue de la suite NVIDIA AI (Triton, CUDA, NCCL).
  • Expérience probante dans le développement de services d'inférence et d'API pour modèles (compatibles OpenAI ou propriétaires).
  • Connaissance approfondie de la conteneurisation et de l'orchestration : Docker, Kubernetes, Helm ; expérience opérationnelle des charges GPU sur Kubernetes.
  • Maîtrise des techniques d'optimisation de modèles : quantification, élagage, parallélisme de tenseurs, parallélisme de pipeline, précision mixte.
  • Solides compétences en ingénierie système et réseau (stockage/E-S, interconnexions GPU, optimisation RDMA/NCCL) et maîtrise des primitives d'entraînement distribué.
  • Compétences affirmées en développement logiciel dans au moins deux des langages suivants : Python, Go ou C++ ; expérience dans le développement d'outils CLI et de SDK.
  • Pratique des architectures d'observabilité et de télémétrie (Prometheus, Grafana, ELK/EFK, OpenTelemetry) ainsi que du suivi analytique des coûts et des consommations.
  • Maîtrise des principes de sécurité et d'isolation pour environnements multi-locataires, de la gestion des secrets et du contrôle d'accès.
  • Expérience avérée dans la conduite de services critiques en production (SLO/SLI/SLA), la gestion d'incidents et la planification capacitaire.
  • Excellentes capacités de communication et de travail en équipe interdisciplinaire (infrastructure, data, ML, produit).
  • Bilinguisme français et anglais requis.

Önskade kvalifikationer

  • Expérience dans la conception de _marketplaces_ de modèles, la mise en place de systèmes de facturation ou la gestion de quotas et facturations multi-locataires.
  • Pratique des frameworks d'agents autonomes (_agentic frameworks_), des pipelines RLHF ou des couches d'orchestration pour le raisonnement multi-tours (_multi-turn reasoning_).
  • Connaissance des frameworks spécialisés dans le service d'inférence : Triton, KServe, TorchServe.
  • Expérience pratique de la virtualisation GPU (MIG), des ordonnanceurs Kubernetes et des problématiques d'approvisionnement matériel ou micrologiciel (_firmware_).
  • Maîtrise de l'intégration des passerelles API compatibles OpenAI, de la limitation de débit (_rate limiting_), de la gestion de versions des modèles et des stratégies de déploiement A/B.
  • Connaissance approfondie des exigences réglementaires liées aux modèles d'IA (résidence des données, contrôles à l'exportation).

Förmåner

  • Possibilité d'une prime annuelle basée sur la performance de l'entreprise et individuelle.
  • Choix de 3 options de régime médical et dentaire, avec couverture de base financée par Ericsson.
  • Contribution automatique de 2% de l'entreprise au régime de retraite.
  • Correspondance de 50% de la contribution de l'employé au Régime d'épargne-retraite enregistré, jusqu'à 8% de la contribution de l'employé (maximum de 4% de contrepartie).
  • Assurance vie de base et couverture pour décès accidentel et mutilation (deux fois le salaire de base annuel) sans frais.
  • Couverture pour invalidité de courte durée.
  • Possibilité de participer au plan d'achat d'actions d'Ericsson.
  • Minimum de 18 jours de congés accumulés, plus au moins 3 jours personnels.
  • Minimum de 10 jours fériés, 1 jour de bénévolat et des jours de maladie.
  • Jusqu'à 10 semaines de congé de maternité payé.
  • 6 semaines de congé parental ou d'adoption à 100% du salaire.
  • Programmes de bien-être financier.
  • Aide éducative.
  • Cadeaux jumelés.
  • Compte bien-être.
  • Programmes de reconnaissance.
#IA Générative#LLM#GPU#MLOps#SRE#SecOps#Kubernetes
Ericsson Logo

Företag

Ericsson

Publicerade jobb

för 1 månad sedan

Anställningstyp

Heltid

Arbetsform

Hybrid

Erfarenhetsnivå

Senior

Platser

Montreal, Canada

Sökande

Ansök tidigt