Doctorant F/H Mesure de l'injection de narratifs dans les modèles de langue
Contract type : Fixed-term contract
Renewable contract : Yes
Level of qualifications required : Graduate degree or equivalent
Fonction : PhD Position
Context
Les grands modèles de langage (Large Language Models, LLMs) sont entraînés sur des volumes massifs de données issues du web et de sources diverses. La qualité et l’intégrité de ces données sont devenues un enjeu majeur, car elles peuvent contenir des contenus biaisés, manipulatoires ou intentionnellement malveillants.
Un risque émergent est celui du LLM grooming, c’est-à-dire l’injection progressive de contenus idéologiques ou propagandistes dans les corpus publics afin d’influencer le comportement futur des modèles. Ce phénomène peut être rapproché de formes de data poisoning, dans lesquelles des acteurs malveillants introduisent des données spécifiques pour altérer les capacités, les biais ou les réponses d’un modèle.
Dans ce contexte, ce projet vise à identifier, caractériser et détecter la propagande et les tentatives de manipulation dans les données utilisées pour le pré-entraînement et le post-training des LLMs, afin de mieux comprendre leurs effets sur le comportement des modèles et de développer des outils de détection et de mitigation.
Assignment
-
Étudier la présence de propagande, manipulation informationnelle et contenus idéologiques dans les corpus utilisés pour l’entraînement des LLMs.
-
Concevoir des outils d’analyse et de filtrage des données à grande échelle (web datasets, corpus instruction-tuning, RLHF data, etc.).
-
Étudier l’impact de ces données sur le comportement des modèles via des expérimentations contrôlées.
-
Contribuer à la production de datasets annotés et benchmarks pour la détection de propagande dans les données d’entraînement.
- Contribuer à la construction de modèles instrumentés illustrant les phénomènes considérés
Le doctorant recruté travaillera au sein de l'équipe ALMAnaCH, sous la responsabilité scientifique de Djamé Seddah.
Main activities
La personne recrutée devra effectuer les missions classiques d'un doctorant dans une équipe de pointe.
Skills
Compétences techniques requises :
-
Excellent niveau en Python, ainsi qu’une bonne maîtrise des outils utilisés en data science, deep learning et traitement automatique du langage naturel (NLP).
-
Expérience dans la conduite d’expérimentations à grande échelle.
Compétences relationnelles :
-
Capacité à travailler en équipe, tout en faisant preuve d’autonomie.
-
Motivation à partager et diffuser les résultats (publications, présentations, documentation).
Autres qualités appréciées :
-
Enthousiasme.
-
Esprit d’équipe.
Benefits package
- Restauration subventionnée
- Transports publics remboursés partiellement
- Congés: 7 semaines de congés annuels + 10 jours de RTT (base temps plein) + possibilité d'autorisations d'absence exceptionnelle (ex : enfants malades, déménagement)
- Possibilité de télétravail et aménagement du temps de travail
- Équipements professionnels à disposition (visioconférence, prêts de matériels informatiques, etc.)
- Prestations sociales, culturelles et sportives (Association de gestion des œuvres sociales d'Inria)
- Accès à la formation professionnelle
- Sécurité sociale
General Information
- Theme/Domain :
Language, Speech and Audio
Instrumentation et expérimentation (BAP C) - Town/city : Paris
- Inria Center : Centre Inria de Paris
- Starting date : 2026-10-01
- Duration of contract : 3 years
- Deadline to apply : 2026-08-31
Warning : you must enter your e-mail address in order to save your application to Inria. Applications must be submitted online on the Inria website. Processing of applications sent from other channels is not guaranteed.
Instruction to apply
Defence Security :
This position is likely to be situated in a restricted area (ZRR), as defined in Decree No. 2011-1425 relating to the protection of national scientific and technical potential (PPST).Authorisation to enter an area is granted by the director of the unit, following a favourable Ministerial decision, as defined in the decree of 3 July 2012 relating to the PPST. An unfavourable Ministerial decision in respect of a position situated in a ZRR would result in the cancellation of the appointment.
Recruitment Policy :
As part of its diversity policy, all Inria positions are accessible to people with disabilities.
Contacts
- Inria Team : ALMANACH
-
PhD Supervisor :
Seddah Djame / Djame.Seddah@inria.fr
The keys to success
La personne recrutée devra être titulaire d'un diplome bac+5 en NLP et sciences cognitives.
Un interet évident pour les sciences sociales et poliques serait un plus.
Le sujet sera concentré sur des narratifs français et italien.
La maitrise de ces deux langues et de leurs environnement socio-politique est donc absolument nécessaire. Une maitrise du dialecte napolitain et de l'argot en vigueur dans la région serait un atout considérable pour cette thèse.
Merci de ne pas postuler si les conditions précèdentes ne sont pas remplies.
About Inria
Inria, the French national institute for research in digital science and technology, supports the French government in national research and innovation strategies in the digital field, acting as Digital Programs Agency. Inria leads over 300 research and innovation projects with its 3,500 scientists, engineers, and support staff, in partnership with universities and the digital ecosystem (businesses, entrepreneurs, and public stakeholders). Together, we explore strategic fields such as artificial intelligence, cybersecurity, quantum computing, cloud technologies, digital transformation in healthcare, digital twins, and digital technologies for defence. We develop practical solutions such as software, tech startups, partnerships with national companies, and cutting-edge training programmes. Our goal is to drive scientific, technological, and industrial excellence to ensure France’s digital sovereignty.