Back to jobsSign in and upload your CV to see how well you match this job.
Sign inJob overview
- Location
- Montreal, Canada
- Workplace
- On-site
- Employment type
- Full-time
- Experience level
- Lead
- Date posted
- Oct 5, 2026
- Last checked at the source
- Oct 7, 2026
- Job source
- via Workable
Requirements
Qualifications requises
• Plus de 7 ans d'expérience dans la création et l'exploitation d'infrastructures de production.
• Expérience dans la direction de la conception, de la livraison et de l'exploitation de plateformes de production, y compris les revues techniques, les normes d'ingénierie et le mentorat.
• Solide expérience du déploiement, de l'exploitation et du dépannage de Linux, des conteneurs, de Kubernetes et de Docker, y compris la gestion des réseaux et du stockage persistant.
• Expérience de la gestion d'infrastructure sous forme de code et de l'utilisation d'outils comme Helm pour paqueter et déployer des systèmes multiservices dans divers environnements et matériels, avec gestion des accès et des secrets.
• Expérience dans la création et l'exploitation d'infrastructures d'intégration continue (CI) et de flux de travail de publication vérifiant le déploiement, les mises à niveau, les retours en arrière, les sauvegardes et les restaurations.
• Expérience de la gestion de la télémétrie d'infrastructure basée sur OpenTelemetry, de l'intégration à l'analyse avec la suite Grafana LGTM ou un équivalent.
• Expérience avec Ansible et des outils d'infrastructure-code open source, combinée à de fortes compétences en script shell et en programmation Python (ou langage similaire) pour automatiser des plateformes et concevoir des services et des outils.
• Excellente maîtrise du français et de l'anglais, à l'oral comme à l'écrit; capacité à expliquer des compromis techniques et à rédiger des guides d'exploitation et de dépannage clairs pour permettre un déploiement et une exploitation autonomes de la pile par les partenaires.
Expérience utile
• Exploitation de GPU ou d'autres accélérateurs et de charges de travail d'inférence d'IA en production.
• Déploiement de logiciels sur des infrastructures exploitées par des clients ou des partenaires.
• Déploiement dans des environnements isolés (« air-gapped »), réglementés ou souverains.
• Maintenance ou contribution à des projets d'infrastructure open source.
• Intégration de déploiements avec des services d'identité externes.
Required Qualifications
• 7+ years of experience building and operating production infrastructure.
• Experience leading the design, delivery, and operation of production platforms, including technical reviews, engineering standards, and mentoring.
• Deep experience deploying, operating, and troubleshooting Linux, containers, Kubernetes, and Docker, including networking and
Benefits
De bonnes raisons pour travailler à Mila
• L’occasion de contribuer à une mission unique avec un impact important;
• Un programme d’assurance collective complet (maladie, dentaire, invalidité, vie, assurance voyage et garanties complémentaires);
• Un programme d’aide aux employés et à la famille;
• Un accès à un service de télémédecine;
• Une politique de congés annuels offrant une base de 20 jours de vacances dès l’embauche;
• Un régime d’épargne retraite avec contribution de l’employeur minimale de 4%;
• Une généreuse enveloppe flexible vous permettant de personnaliser vos avantages sociaux en fonction de ce qui contribue à votre bien-être. Vous pouvez sélectionner et combiner les options qui correspondent à vos besoins parmi les crédits style de vie, une assurance bonifiée, des journées de vacances supplémentaires et une contribution enrichie au régime de retraite;
• Un horaire flexible, un horaire d’été et une possibilité de télétravail;
• Un milieu de travail au cœur de la Petite Italie, dans le quartier branché Mile-Ex, à proximité des transports en commun;
• Une équipe d’experts de leur domaine, des gens passionnés et passionnants;
• Une ambiance de travail collaborative et inclusive.
Nous voulons vous connaître
À Mila, la diversité nous tient à cœur. Nous valorisons un environnement de travail équitable, ouvert et respectueux des différences. Nous encourageons toute personne souhaitant œuvrer dans un écosystème en progression continue et stimulée à contribuer à l’application et la définition d’une culture saine et inclusive, à postuler.
Veuillez noter que seules les personnes sélectionnées seront contactées.
https://mila.quebec/fr/protection-de-la-vie-privee
Good reasons to work in Mila
• The opportunity to contribute to a unique mission with a major impact;
• A comprehensive group insurance program (health, dental, disability, life, travel and extended benefits);
• An employee and family assistance program;
• Access to a telemedicine service;
• A vacation policy offering a base of 20 days' vacation upon hiring;
• A retirement savings plan with a minimum employer contribution of 4%;
• A generous flexible package allowing you to tailor your benefits to what contributes to your well-being. You can select and combine options to suit your needs, including lifestyle credits, enhanced insurance, extra vacation days and enriched pension contributions;
• Flexible working hours, a summer schedule and the possibility of telecommuting;
Skills
- Python
- Bash
- Machine Learning
- Deep Learning
- Docker
- Kubernetes
- Ansible
- CI/CD
- Linux
- Networking
Visa and relocation
?The posting doesn't mention visa sponsorship. Check the original posting or ask the company.
?The posting doesn't mention relocation.
Job description
À propos de Mila
Fondé par le professeur Yoshua Bengio de l’Université de Montréal, Mila rassemble des chercheurs spécialisés en intelligence artificielle et plus précisément en apprentissage automatique, apprentissage profond et apprentissage par renforcement. Reconnu mondialement pour ses importantes contributions au domaine de l’apprentissage profond, Mila s’est particulièrement distingué dans la modélisation du langage, la traduction automatique, la reconnaissance d’objets et les modèles génératifs. Depuis 2017, Mila est le fruit d’une collaboration entre l’Université de Montréal et l’Université McGill, en lien étroit avec Polytechnique Montréal et HEC Montréal.
Mila s’est donné pour mission d’être un pôle mondial d’avancées scientifiques qui inspire l’innovation et l’essor de l’intelligence artificielle (IA) au bénéfice de tous.
Pour en connaitre davantage, veuillez consulter https://mila.quebec/
About Mila
Founded by Professor Yoshua Bengio of the Université de Montréal, Mila brings together researchers specializing in artificial intelligence, and more specifically in machine learning, deep learning and reinforcement learning. Recognized worldwide for its important contributions to the field of deep learning, Mila has particularly distinguished itself in language modeling, machine translation, object recognition and generative models. Since 2017, Mila has been the fruit of a collaboration between Université de Montréal and McGill University, with close links to Polytechnique Montréal and HEC Montréal.
Mila's mission is to be a global hub of scientific advances that inspires innovation and the rise of artificial intelligence (AI) for the benefit of all.
To find out more, please visit https://mila.quebec/
Sommaire du poste: Spécialiste principal de la plateforme, Laboratoire d'IA Souveraine
Le Laboratoire d'IA Souveraine est une nouvelle initiative de Mila visant à assembler une pile (stack) d'inférence IA open source et prête pour les entreprises, que les organisations peuvent déployer et exploiter sur des infrastructures qu'elles contrôlent. Elle regroupe des fonctionnalités telles que le service de modèles, la recherche d'information, l'orchestration d'agents, l'observabilité et un plan de contrôle pour gérer ces composants comme un produit cohérent.
Relevant du directeur principal du dévellopement logiciel , vous concevrez et maintiendrez à jour des paquets de déploiement et d'automatisation pour la pile. Ces paquets et automatisations permettent aux partenaires de déployer, mettre à niveau et restaurer la pile sur leur propre infrastructure, d'un simple nœud jusqu'à des grappes Kubernetes de production. Vous travaillerez avec l'équipe d'intégration pour paqueter leurs composants et les déployer dans des environnements de référence via des flux de travail partagés. Vous recommanderez des technologies de plateforme basées sur des tests reproductibles, des exigences opérationnelles et l'adéquation à l'architecture. Ce rôle ne comporte pas de garde sur appel.
Le succès signifie que les partenaires peuvent déployer, mettre à niveau, restaurer et exploiter la pile de manière autonome dans les environnements pris en charge, en utilisant des automatisations et des guides d'utilisation vérifiés.
Principales responsabilités
• Concevoir et maintenir l'infrastructure-code pour les environnements pris en charge. Documenter les exigences matérielles et d'infrastructure.
• Évaluer les technologies de plateforme open-source par le biais de tests et de bancs d'essai reproductibles. Consigner les méthodes, les résultats, les limites et les risques de maintenance. Recommander des options.
• Créer et maintenir des packages de déploiement versionnés et des flux de travail partagés avec l'équipe d'intégration. Automatiser l'installation, la configuration, les mises à niveau, les retours en arrière, les sauvegardes et les restauations.
• Construire et gérer l'infrastructure d'intégration continue (CI) et des environnements de référence reproductibles. Automatiser les tests de publication sur l'ensemble des environnements pris en charge et enregistrer les résultats.
• Mettre en place et tester les contrôles de sécurité et les paramètres sécurisés par défaut de la plateforme. Tester les mises à jour de sécurité avant de les intégrer aux versions. Fournir des guides de procédures testés pour permettre aux partenaires de connecter leurs systèmes d'identité et d'accès.
• Connecter la télémétrie de l'infrastructure aux services d'observabilité de la pile. Paqueter les tableaux de bord et les alertes de la plateforme.
• Tester la fiabilité, les performances, la capacité et l'utilisation des ressources de la plateforme par rapport aux objectifs convenus. Utiliser les résultats pour améliorer la configuration des déploiements, les packages et l'automatisation.
• Reproduire les échecs de déploiement signalés par les partenaires dans les environnements de référence. Publier des correctifs pour les packages de déploiement et l'automatisation.
• Maintenir et vérifier les guides d'exploitation, les guides de dimensionnement et les instructions de dépannage afin que les partenaires puissent déployer et exploiter la pile de manière indépendante.
• Diriger la conception et la mise en œuvre de la plateforme. Établir des normes d'ingénierie, réviser le travail technique et mentorer les ingénieures et ingénieurs.
Position Summary: Staff Platform Specialist, Sovereign AI Lab
The Sovereign AI Lab is a new Mila initiative to assemble an enterprise-ready, open-source AI inference stack that organizations can deploy and operate on infrastructure they control. It brings together functionalities such as model serving, retrieval, agent orchestration, observability, and a control plane to operate these components as one coherent product.
Reporting to the Senior Director of Engineering, you will build and maintain deployment packages and automation for the stack. The packages and automation let partners de
GetGlobalJob is not the employer or a recruiting agency. You apply on the original publisher's site: always check the posting before sharing your details, and never pay for a job.
Check your fit for this job
Create your free account and upload your CV to see how well you match this job and which skills you're missing.
Check my fit