DevOps Ingénieur. H/F - Outscale
- CDI
- Outscale
Les missions du poste
Nous recrutons un·e Ingénieur DevOps afin de renforcer notre équipe Kubernetes.
OUTSCALE, marque de Dassault Systèmes, est un opérateur souverain et durable de l'Expérience en tant que Service qui offre à ses clients des environnements technologiques de confiance.
Nous offrons des expériences uniques grâce au savoir-faire de nos équipes passionnées, qui se reflète notamment par la création de solutions de Business Expériences, le développement de notre propre orchestrateur Cloud, TINA OS, ou encore l'obtention de la qualification SecNumCloud.
Vos missions
- Mettre en place et maintenir des pipelines CI/CD ainsi que l'infrastructure en tant que code (Terraform, Ansible, Helm) utilisés pour déployer et mettre à jour notre service Kubernetes.
- Automatiser les tâches opérationnelles récurrentes du cycle de vie du cluster (provisionnement, mises à jour, configuration, sauvegarde) et améliorer nos outils internes.
- Contribuer à l'exploitation et à l'évolution de nos pools de noeuds GPU en production (pilotes, opérateur GPU, plugin de périphérique, stratégies de planification et de partage, gestion des capacités).
- Déployer, configurer et maintenir les composants de la plateforme d'IA/ML sur Kubernetes : service de modèles (KServe, vLLM, Triton), outils de workflow et d'entraînement (Kubeflow, Ray, Argo Workflows), magasins de vecteurs.
- Étendre notre pile d'observabilité (Prometheus, Grafana, logs, traces) avec les métriques pertinentes pour les charges de travail d'IA : utilisation des GPU, files d'attente, latence, coût.
- Travailler sur l'autoscaling et l'efficacité des ressources (HPA, KEDA, autoscaling des clusters) pour les charges de travail d'IA en pics de trafic et coûteuses.
- Appliquer et automatiser nos standards de sécurité et de conformité : RBAC, politiques réseau, politiques d'admission (Kyverno), chaîne d'approvisionnement des images, gestion des secrets.
- Participer à la rotation des astreintes 24 h/24 et 7 j/7 de l'équipe sur les systèmes de production : détecter, trier et résoudre les incidents, les escalader vers les équipes de développement lorsque la cause première dans le code, et contribuer aux analyses rétrospectives et aux guides d'intervention. Vous ne rejoindrez la rotation qu'une fois votre intégration terminée, et jamais seul(e).
- Identifier, en collaboration avec l'équipe, les problèmes opérationnels et de sécurité pour lesquels un modèle apporte une réelle valeur ajoutée - et être tout aussi capable de déterminer quand ce n'est pas le cas.
- Concevoir, entraîner, évaluer et déployer des modèles appliqués à la télémétrie de la plateforme : détection d'anomalies sur les métriques et les journaux, prévision des capacités et des coûts, corrélation des alertes et réduction du bruit, prédiction des pannes.
- Contribuer à la détection axée sur la sécurité : analyse comportementale des journaux d'audit Kubernetes et des événements d'exécution, détection d'activités anormales ou malveillantes, enrichissement de nos règles de détection.
Votre profil
- Idéalement diplômé(e) d'un Master en ingénierie informatique, vous avez une première expérience professionnelle dans les domaines du DevOps, du SRE, des plateformes, de l'infrastructure ou de l'ingénierie en apprentissage automatique appliqué - les stages, les apprentissages et les projets personnels ou open source sont pris en compte.
- Vous avez de solides bases sous Linux : ligne de commande, processus, systèmes de fichiers, systemd, dépannage.
- Vous maitrisez Python tant pour l'automatisation que pour le traitement des données (pandas, NumPy, scikit-learn) - avec une volonté d'apprendre le langage Go.
- Vous connaissez les principes fondamentaux de l'apprentissage automatique : approches supervisées vs non supervisées, méthodologie d'entraînement/de test, indicateurs d'évaluation, surapprentissage.
- Vous avez une première expérience pratique des conteneurs et de Kubernetes (Docker/containerd, Pods, Deployments, Services, ConfigMaps) en tant qu'utilisateur de la plateforme.
- Vous connaissez les workflows basés sur Git et des principes de CI/CD et d'« Infrastructure as Code ».
- Vous êtes capable de travailler avec des données opérationnelles : interrogez les métriques et les journaux, et les transformez en un ensemble de données exploitable.
- Vous comprenez la base des réseaux (TCP/IP, DNS, HTTP, TLS) et de la sécurité des systèmes Linux.
- Vous participez à un roulement d'astreinte 24 h/24 et 7 j/7 sur les systèmes de production, une fois formé et accompagné par l'équipe.
- Curiosité, rigueur et capacité à apprendre rapidement dans un environnement technique complexe.
- Bonnes compétences en communication et goût pour le travail en équipe agile, à distance ou interfonctionnel.
- Maîtrise professionnelle de l'anglais (écrit et parlé).
La Diversité d'OUTSCALE trouve aussi son expression dans notre politique de recrutement qui privilégie l'égalité des chances, la diversité des individus au sein de nos équipes.
Nous rejoindre c'est aussi
Intégrer une entreprise scientifique au coeur de l'innovation technologique, portée par une forte croissance depuis plus de 40 ans
Principaux avantages et bénéfices :
- Environnement multiculturel
- Cadre de travail convivial axé sur le bien-être et la santé
- Engagement en faveur de la diversité et de l'inclusion Politique dynamique de développement de carrière : plan de formation, mobilités internes, etc.
Vous souhaitez en savoir plus ? N'hésitez pas à nous suivre sur Linkedin et découvrez nos dernières offres et actus.
OUTSCALE, marque de Dassault Systèmes, est un opérateur souverain et durable de l'Expérience en tant que Service qui offre à ses clients des environnements technologiques de confiance.
Nous offrons des expériences uniques grâce au savoir-faire de nos équipes passionnées, qui se reflète notamment par la création de solutions de Business Expériences, le développement de notre propre orchestrateur Cloud, TINA OS, ou encore l'obtention de la qualification SecNumCloud.
Notre mission ? Bâtir un monde numérique accessible et meilleur pour tous à travers la création du jumeau virtuel de l organisation.
Nous menons une politique RH engagée et inclusive favorisant le bien-être de nos collaborateur·rices : respect de l'équilibre vie privée/vie professionnelle, développement personnel et des compétences professionnelles, onboarding complet
Nous rejoindre, c'est partager une passion pour l'innovation, des valeurs communes et imaginer ensemble des solutions de confiance pour construire un monde meilleur et durable !
Compétences requises
- Docker
- Gestion des données
- Python
- Anglais
- Travail en équipe
- Cluster
- TCP/IP
- Kubernetes
- TLS
- Terraform
- Machine learning
- Git
- Ansible
- Grafana
- Linux
- Prometheus