Thèse Intelligence Artificielle pour la Veille Épidémiologique Détection des Signaux Faibles dans les Médias Écrits et Radiophoniques Retranscrits pour des Langues Sous-Représentées H/F - Doctorat.Gouv.Fr
- CDD
- Doctorat.Gouv.Fr
Les missions du poste
Établissement : Université de Montpellier École doctorale : I2S - Information, Structures, Systèmes Laboratoire de recherche : TETIS - Territoire Environnement Teledetection et Information Spatiale Direction de la thèse : Maguelonne TEISSEIRE ORCID 0000000193136414 Début de la thèse : 2026-10-01 Date limite de candidature : 2026-08-18T23:59:59 La thèse proposée s'inscrit dans le domaine de la détection précoce des indicateurs de risque épidémiologique à partir de données de retranscription radiophonique et de données journalistiques exprimées dans les langues indigènes des pays de l'océan Indien et provenant des médias locaux. Les pays de l'océan Indien sont défavorisés par l'utilisation d'approches d'IA pour la détection précoce des risques épidémiologiques en raison de l'inégalité de la disponibilité et de la richesse des ressources en information. L'objectif de cette thèse est double : premièrement, extraire et représenter les concepts spatio-temporels et les concepts de risque épidémiologique afin de détecter des informations qui sont non seulement spécifiques à la population indigène, mais également riches en termes de qualité, de précision et de quantité ; deuxièmement, représenter les données sous forme de graphes de connaissances et exploiter les liens sémantiques présents pour extraire des indicateurs sémantiques des risques épidémiologiques qui pourraient compléter les indicateurs standard utilisés par les experts dans ce domaine. La prise en compte de la complexité des données de transcription exprimées dans les langues locales est un défi actuel pour lequel il existe peu de solutions efficaces. Le projet se concentre sur la proposition d'une méthodologie qui intègre le traitement automatique du langage, la représentation sémantique des données et l'apprentissage automatique afin de déterminer le contexte des risques épidémiologiques et d'identifier des indicateurs. Les approches proposées seront évaluées sur un corpus déjà collecté à partir des données de transcription d'une station de radio de La Réunion couvrant le partage d'informations par les populations autochtones sur divers sujets pendant plusieurs années. Les approches d'évaluation seront définies en collaboration avec des experts dans le domaine. Les crises épidémiologiques concernent les maladies connues mais également des maladies inconnues évoquées dans différentes sources d'informations telles que les médias locaux (écrits ou radiophoniques). Il a été montré que les modèles d'IA disposent généralement de moins d'informations géographiques précises pour les pays qui sont les plus sensibles aux crises épidémiologiques, comme c'est le cas des pays de l'océan Indien. Ces pays sont donc vulnérables à plus d'un titre : tout d'abord, face à la propagation de maladies qui se transmettent entre la population animal et humaine (contexte One Health) telles que la Rift, Rage, Mpox, Influenza et ensuite, face à la défaillance des nouveaux outils avancés d'intelligence artificielle qui ne prennent pas en compte les information épidémiologiques et spécificités spatiales.
L'enjeu est sociétal et le défi est de mettre en place des systèmes de surveillance intelligents permettant d'aboutir à une équité voire une vraie justice spatiale.
Cette thèse, co-financée par l'INRAE et le CIRAD, s'inscrit dans le cadre du projet européen GeoAI4AI qui vise à mettre en place un environnement européen d'intelligence artificielle dédié à l'épidémiologie afin de renforcer les capacités d'anticipation et d'aide à la décision face aux émergences et autres crises sanitaires.
La thèse sera organisée en quatre grandes tâches, dont trois se succéderont de façon progressive (T1-T3), tandis que la quatrième (T4) sera menée en parallèle tout au long du doctorat.Période 1 - Exploration et constitution des ressources (T1a, T1b) : Réalisation d'un état de l'art détaillé sur les approches existantes pour la représentation des données vocales, en considérant les méthodes avec et sans transcription (T1a). Analyse critique des limites des approches standards pour les langues à ressources limitées, notamment le créole réunionnais et le malgache. Collecte de données originales : élargissement des corpus audio aux radios locales, aux journaux, et à d'autres langues de la région Océan Indien choisies en partenariat avec les experts (T1b). Prétraitement, annotation et structuration de ces données pour constituer un corpus exploitable pour les étapes ultérieures. Période 2 - Développement méthodologique (T2). Conception et définition de méthodes originales d'extraction et de représentation des connaissances issues des données collectées. Mise au point d'approches hybrides combinant apprentissage automatique, traitement automatique du langage naturel (TALN) et graphes de connaissances. Développement d'indicateurs spatio-temporels et thématiques, adaptés au niveau local (quartiers, villages) et sensibles aux spécificités linguistiques (symptômes exprimés en créole et/ou malgache). Premières expérimentations sur un sous-ensemble de données . Période 3 - Validation et application (T3) Évaluation des méthodes développées sur des cas d'étude en collaboration avec les experts du DP One Health et les partenaires de Madagascar. Comparaison avec des systèmes de veille existants pour mesurer l'apport en termes de précision et de granularité spatiales des signaux épidémiologiques détectés. Analyse critique des résultats et formulation de recommandations méthodologiques pour la surveillance épidémiologique dans les contextes à ressources limitées.
Le profil recherché
· Master Recherche ou équivalent en sciences des données et Intelligence Artificielle.
· Un vif intérêt pour la recherche et une passion pour le développement d'applicationspluridisciplinaires.
· Solides compétences en programmation, machine learning, intelligence artificielle etTALN.
· Des compétences sur la sémantique des données serait un plus.
· Un vif intérêt pour la recherche et une passion pour le développement d'applicationspluridisciplinaires.
· Solides compétences en programmation, machine learning, intelligence artificielle etTALN.
· Des compétences sur la sémantique des données serait un plus.
Compétences requises
- Intelligence artificielle
- Machine learning
- Malgache