Le Centre Léon Bérard (#CLB), membre de la fédération Unicancer, est LE pôle de référence régional en cancérologie. Regroupant 2.300 collaborateurs sur un site unique à Lyon 8ème, nous sommes à la fois un hôpital et un centre de recherche.
Nous assurons 3 missions essentielles :
- Le soin : nos équipes soignantes prennent en charge plus de 42.000 patients par an, avec des soins personnalisés et innovants
- La recherche : nos chercheurs et médecins travaillent main dans la main, couvrant les domaines de la recherche fondamentale, translationnelle et clinique
- L’enseignement : chaque année, nous assurons la diffusion des savoirs et formons nos collaborateurs et des professionnels extérieurs
Le CLB est impliqué dans des projets d’intelligence artificielle depuis plusieurs années avec des partenariats académiques et industriels. Ces projets bénéficient de notre importante base de données de plus de 340 000 patients dans un dossier patient développé en interne et qui a été progressivement informatisé depuis 1993.
Depuis quelques années le CLB s’est engagé dans des projets intégrant l’Intelligence Artificielle (IA) et les Big Data en santé. Les prérequis à l’utilisation des données de santé et l’intégration de l’IA en routine est la disponibilité de données structurées et de qualité. C’est devant cette nécessité que la Data Factory a été créée en 2021, dont les objectifs sont de structurer et fiabiliser les données, ce qui implique notamment : (i) Rendre exploitable (extraire l’information utile) une grande quantité de données disponible (ii) Élargir le périmètre des données interconnectées, structurées et requêtables (iii) À plus long terme, la création d’un gisement de données multi-sources, réparti et accessible pour les cliniciens et les chercheurs, basé sur le modèle de données OSIRIS.
Description du poste
L’équipe Data Factory est dédiée à la mise en œuvre et au pilotage de projets de réutilisation de données massives (Big Data). Elle permet l’extraction et le traitement de données des données de santé à destination des projets de recherche clinique ou des industriels.
Intégré à une équipe pluridisciplinaire (ingénieurs ML/NLP, data managers, médecins, bio-informaticiens), vous contribuerez à la chaîne de structuration automatique des documents médicaux : de la numérisation et l’extraction de texte (OCR) jusqu’à l’extraction d’information par modèles de langage (NLP, LLM). Cette alternance, encadrée par un tuteur dédié, est une opportunité de monter en compétence sur des cas d’usage réels tout en poursuivant votre formation.
Missions :
Sous la responsabilité de votre tuteur, et en montant progressivement en autonomie, vous participerez à :
• Extraction et prétraitement des documents (OCR) : mise en place et évaluation de pipelines de numérisation et de reconnaissance de caractères pour :
– Vérifier la bonne correspondance des documents du patient dans son dossier (identitovigilance),
– convertir des comptes-rendus en texte exploitable.
• Structuration par NLP : développement de composants de traitement automatique du langage (nettoyage, segmentation, extraction d’entités, classification) adaptés aux documents médicaux.
• Expérimentations avec des LLM : tests et adaptation de grands modèles de langage pour l’extraction et la structuration d’informations cliniques (prompting, évaluation, supervision faible).
• Développement Python : écriture de scripts et de modules réutilisables, contribution à des outils internes, avec de bonnes pratiques de versionnage et de tests.
• Gestion des données : interrogation et manipulation de bases de données (SQL), construction et alimentation de jeux de données structurés.
• Évaluation et documentation : mesure des performances des modèles, analyse des résultats et rédaction d’une documentation claire.
Profil recherché
Formation :
• Étudiant(e) en première année de Master en Data Science, Informatique, Statistiques, Mathématiques appliquées ou formation équivalente, recherchant une alternance.
Compétences techniques :
• Bonnes bases en programmation Python.
• Première expérience ou intérêt marqué pour le traitement automatique du langage (NLP) et les modèles de langage (LLM).
• Notions de manipulation de données et de bases de données (SQL, Pandas).
• La connaissance d’outils de versionnage (Git) est appréciée.
Qualités personnelles :
• Curiosité, autonomie et envie d’apprendre.
• Rigueur, sens de l’organisation.
• Goût du travail en équipe dans un environnement pluridisciplinaire.
• Intérêt pour les applications de l’IA en santé.
Avantages
Ce que nous offrons :
• Une alternance sur un projet concret à fort impact pour la recherche en oncologie.
• Un encadrement par des ingénieurs spécialisés en NLP clinique et un tutorat individualisé.
• La montée en compétence sur des technologies de pointe (OCR, NLP, LLM) et des données réelles.
• Un environnement de travail stimulant au sein d’un centre de lutte contre le cancer.