Conception et mise en oeuvre d'un protocole d'entraînement d'un LLM médical français
Type de contrat : CDD
Niveau de diplôme exigé : Bac + 5 ou équivalent
Autre diplôme apprécié : thèse
Fonction : Ingénieur scientifique contractuel
Niveau d'expérience souhaité : Jeune diplômé
Contexte et atouts du poste
Cette proposition de poste s'inscrit dans le cadre du projet FG4H financé par la BPI, projet qui a vocation à développer un grand modèle de langue (LLM) spécialisé pour le domaine médical français, en s'appuyant sur plusieurs millions de dossiers patients fournis par les partenaires du projets.
Pour des raisons de confidentialités des données, l'entraînement et la validation de ce modèle prendra place au sein d'une infrastructure sécurisée, ce qui pose des contraintes fortes.
La personne retenue sera un acteur majeur dans la définition du protocole d'entraînement et de mise en oeuvre initiale de ce protocole, en coordination avec les partenaires du projet et en fonction des contraines liées à l'infrastructure de calcul.
Mission confiée
Missions :
En relation avec les membres de l'équipe ALMANACH (plus particulièrement Éric de la Clergerie), et en interaction avec les partenaires médicaux, la personne recrutée devra définir un protocole précis pour l'entraînement du modèle médical, avec en premier lieu le choix d'un modèle initial dont l'entraînement sera prolongé (par exemple un modèle QWEN 3.* 30 milliards de paramètres) et ensuite les modes optimaux d'exploitation des données cliniques (en continual pretraining ou instruction tuning par exemple).
Des essais préliminaires seront conduits sur des données non confidentielles (données publiques, fictives, ...) pour une évaluation préliminaire des points clés de ce protocole. Ce travail devrait conduire à une bibliothèque de code exploitable pour démarrer l'entraînement à grande échelle.
Dès que ce protocole sera bien établi et que des données cliniques seront disponibles sur l'instrastructure sécurisée de calcul, la personne recrutée sera en charge de lancer et monitorer l'entraînement sur celles-ci, en réalisant les adaptations nécessaires si besoin.
Principales activités
Principales activés :
- veille sur les développpements rapides en IA génératives pour (a) sélectionner le meilleur LLM pouvant servir de base pour le modèle médical et (b) les modes d'entraînement adaptés (probablement à base d'instructions sous forme de tâches)
- conception de tâches pouvant en particulier être synthétisées à partir de dossiers patient
- évaluation à petite échelle des divers modes d'entraînement sur des données non confidentielles
- à partir de ces évaluations, conception d'une bibliothèque de code pouvant facilement être déployée au sein de l'infrastructure sécurisée de calcul.
- recensement de jeux de données pour l'évaluation du modèle, soit existant en français, soit par traduction, soit par distillation à partir de LLM médicaux existants
- mise en oeuvre initiale de l'entraînement du modèle médical une fois les données cliniques disponibles au sein de l'infrastructure sécurisée
Compétences
Compétences techniques et niveau requis :
- excellente maîtrise des techonologies liées aux LLM, en particulier sur leurs entraînements (Continual Pre-Training, Supervised Fine-Tuning, Reinforcement Learning, Distillation, ...) et évaluations, avec la pratique des bibliothèques Python associées
- bonne connaissance des données médicales
- expérience préliminaire dans l'utilisation de plateformes de calcul sécurisées, avec de plus une sensibilisation aux aspects liés à la confidentialité des données
Langues : français, anglais si possible
Compétences relationnelles : capacité à interargir avec de nombreux partenaires dans un cadre pluri-disciplinaire (informatique/IA et médical)
Compétences additionnelles appréciées :
Avantages
- Restauration subventionnée
- Transports publics remboursés partiellement
- Congés: 7 semaines de congés annuels + 10 jours de RTT (base temps plein) + possibilité d'autorisations d'absence exceptionnelle (ex : enfants malades, déménagement)
- Possibilité de télétravail et aménagement du temps de travail
- Équipements professionnels à disposition (visioconférence, prêts de matériels informatiques, etc.)
- Prestations sociales, culturelles et sportives (Association de gestion des œuvres sociales d'Inria)
- Accès à la formation professionnelle
- Sécurité sociale
Informations générales
- Thème/Domaine :
Langue, parole et audio
Statistiques (Big data) (BAP E) - Ville : Paris
- Centre Inria : Centre Inria de Paris
- Date de prise de fonction souhaitée : 2026-10-01
- Durée de contrat : 3 mois
- Date limite pour postuler : 2026-09-26
Attention: Les candidatures doivent être déposées en ligne sur le site Inria. Le traitement des candidatures adressées par d'autres canaux n'est pas garanti.
Consignes pour postuler
Sécurité défense :
Ce poste est susceptible d’être affecté dans une zone à régime restrictif (ZRR), telle que définie dans le décret n°2011-1425 relatif à la protection du potentiel scientifique et technique de la nation (PPST). L’autorisation d’accès à une zone est délivrée par le chef d’établissement, après avis ministériel favorable, tel que défini dans l’arrêté du 03 juillet 2012, relatif à la PPST. Un avis ministériel défavorable pour un poste affecté dans une ZRR aurait pour conséquence l’annulation du recrutement.
Politique de recrutement :
Dans le cadre de sa politique diversité, tous les postes Inria sont accessibles aux personnes en situation de handicap.
Contacts
- Équipe Inria : ALMANACH
-
Recruteur :
Villemonte De La Clergeri Eric / Eric.Villemonte_De_La_Clergerie@inria.fr
L'essentiel pour réussir
La personne recrutée doit être passionnée par les développements de l'IA générative (LLM) et leurs applications sociétales, ici dans le domaine de la santé qui soulève divers défis (confidentialité des données, extrême techinicité des documents médicaux, ...). Elle doit être prête à interagir avec un public divers (informaticiens IA, experts médicaux, gestionaires d'infrastructure, ...). Elle doit également savoir se tenir au courant et prendre en compte des évolutions très rapides dans le domaine de l'IA générative.
A propos d'Inria
Inria, l'institut national de recherche dans les sciences et technologies du numérique, est en appui de l’État pour les stratégies nationales de recherche et d’innovation du numérique en tant qu'Agence de programmes. Inria mène plus de 300 projets de recherche et d’innovation avec ses 3500 scientifiques, ingénieurs et personnels d’appui, en partenariat avec les universités et l’écosystème numérique (entreprises, entrepreneurs, acteurs publics). Ensemble, nous explorons des domaines clés comme l'intelligence artificielle, la cybersécurité, l’informatique quantique, le Cloud, la transformation numérique de la santé, les jumeaux numériques ou encore les technologies numériques pour la défense. Nous construisons des solutions concrètes telles que des logiciels, des startups technologiques, des partenariats avec les entreprises du tissu national et des formations de pointe. Notre objectif : l’impact scientifique, technologique et industriel au service de la souveraineté numérique de la France.