Statistique et Data Science pour la santé et l’environnement

Les données de santé et d’environnement sont souvent hétérogènes, multivariées, longitudinales, corrélées spatialement et temporellement, et incomplètes. Elles constituent ainsi un domaine d’application riche pour l’apprentissage statistique et la science des données. Le L2S développe des méthodes d’apprentissage statistique permettant d’extraire des connaissances pertinentes à partir de données complexes et de construire des modèles interprétables.

Ces recherches s’appuient des collaborations de longue durée, notamment l’institut de Cerveau (ICM), Assistance Publique-Hôpitaux de Paris (APHP), CEA Neurospin, Gustave Roussy, Centre National de Recherche en Génomique Humaine (CNRGH), L’institut Pasteur, ainsi que le projet européen ATHLETE, pour n’en citer que quelques-uns. Nos partenaires donnent accès à diverses cohortes multimodales ainsi qu’à des entrepôts de données de santé.

Thèmes de recherche

Le L2S développe un cadre statistique général pour l’analyse conjointe de plusieurs sources d’information. Ce cadre, appelé Regularized Generalized Canonical Correlation Analysis (RGCCA), permet d’intégrer différents types de données hétérogènes, notamment des données tensorielles, matricielles, fonctionnelles et longitudinales. Il intègre également des méthodes de sélection de variables afin d’identifier les variables les plus pertinentes, facilitant ainsi l’interprétation des résultats et améliorant l’interprétabilité des modèles obtenus.

Nos travaux portent également sur les modèles d’équations structurelles afin d’aller au-delà des simples corrélations et d’étudier les relations causales. En complément, nous développons des modèles de séries temporelles adaptés aux données de comptage, aux observations multivariées et à la présence de valeurs aberrantes. Ces méthodes sont notamment utilisées pour analyser les relations entre la pollution atmosphérique et la santé, modéliser les maladies respiratoires et caractériser les effets des expositions environnementales au cours du temps.

Intégration de données et maladies neurodégénratives


Les maladies neurodégénératives, telles que la maladie d’Alzheimer, la maladie de Parkinson ou la sclérose en plaques, ont une origine multifactorielle. Dans ce contexte, l’observation du patient dans ses différentes dimensions (par exemple, à travers l’imagerie multimodale, les données omiques et les données cliniques) est essentielle. Il est donc nécessaire de développer des méthodes statistiques avancées permettant l’analyse conjointe de ces sources de données volumineuses et hétérogènes.
Collaborations. ICM, Neurospin, CNRGH, Institut Pasteur

Publications sélectionnées

Girka et al. (2024) Tensor generalized canonical correlation analysis, Information Fusion, Volume 102, 102045
Gloaguen et al. (2022). Multiway generalized canonical correlation analysis. Biostatistics, Volume 23, Issue 1, Pages 240–256
Fransson et al. (2024). Multiple sclerosis patient macrophages impaired metabolism leads to an altered response to activation stimuli. Neurology: Neuroimmunology & Neuroinflammation, 11(6), e200312.
Xicota, L. et al. (2019). Multi-omics signature of brain amyloid deposition in asymptomatic individuals at-risk for Alzheimer’s disease: The INSIGHT-preAD study. EBioMedicine, 47, 518-528.
Garali et al. (2018). A strategy for multimodal data integration: application to biomarkers identification in spinocerebellar ataxia. Briefings in Bioinformatics, 19 (6), 1356-1369

Chaire en Intelligence Artificiel et santé



L’objectif de l’Entrepôt de Données de Santé (EDS) de l’AP-HP est de centraliser l’ensemble des données médicales recueillies auprès des patients hospitalisés dans l’un des 39 établissements de l’AP-HP. Le principal enjeu lié à l’exploitation de ces données biomédicales longitudinales, hétérogènes et multicentriques est de contribuer à l’amélioration des soins et au développement d’une médecine plus personnalisée. Dans ce contexte, il est essentiel de développer et d’utiliser des méthodes statistiques adaptées pour répondre aux différentes questions posées par les cliniciens à partir de ces volumes massifs de données. Nous explorons également l’utilisation de modèles pré-entraînés afin de rendre l’intelligence artificielle plus efficace en termes de besoins en données dans les applications médicales.
Collaborations: APHP – L2S- INRIA – DataIA

Publications sélectionnées

Sort et al. (2026) Latent Functional PARAFAC for Modeling Multidimensional Longitudinal Data. Psychometrika. 26:1-25.
Sort et al. (2024) Functional Generalized Canonical Correlation Analysis for studying multiple longitudinal variables, Biometrics, 80(4)

Relations entre between exposome et santé


L’exposome désigne l’ensemble des expositions environnementales auxquelles un individu est soumis au cours de sa vie. L’étude des effets de l’exposome sur la santé constitue un enjeu majeur de santé publique. Ce domaine connaît actuellement une véritable révolution des données, rendant leur analyse statistique particulièrement complexe. Le L2S développe des outils statistiques avancés pour l’analyse des données de l’exposome.
Collaborations: L2S – Athlete European project – UFES (Brésil)

Publications sélectionnées

Tenenhaus et al. (2026). Structural equation modeling with factors and composites within the framework of the basic design. Advances in Data Analysis and Classification, 20(1), 227-254.
Amine et al. (2025). Early-life exposome and health-related immune signatures in childhood. Environment International, 202, 109668
Camara et al (2025). Robust estimate for count time series using GLARMA models: An application to environmental and epidemiological data. Applied Mathematical Modelling, 137, 115658.
Danilevicz et al. (2026). Adaptive LASSO quantile regression with fixed effects. Applied Mathematical Modelling, 153, 116600.
Reisen et al. (2024). A dimension reduction factor approach for multivariate time series with long-memory: a robust alternative method. Statistical Papers, 65(5), 2865-2886.
Danilevicz et al. (2024). A longitudinal study of the influence of air pollutants on children: a robust multivariate approach. Journal of Applied Statistics, 51(11), 2178-2196.

Logiciels open-source

Le L2S met à la disposition de la communauté scientifique plusieurs logiciels open source :

  • Le package R RGCCA propose une implémentation complète du cadre RGCCA, comprenant des algorithmes hautement efficaces, des outils de visualisation graphique ainsi que des méthodes permettant d’évaluer la robustesse et la significativité statistique des résultats. Il est également disponible sur CRAN.
  • Le package R semFC implémente des algorithmes hautement efficaces, dotés de bonnes propriétés statistiques, pour la modélisation par équations structurelles avec facteurs et composites.
  • La régression quantile à effets fixes fournit un cadre flexible pour l’analyse de données longitudinales en tenant compte de l’hétérogénéité individuelle. Les packages R prqfe et alqfe proposent plusieurs méthodes d’estimation fondées sur différentes fonctions de perte et structures de modèles, notamment les effets fixes pénalisés par LASSO. Le LASSO adaptatif possède des propriétés d’oracle intéressantes, tandis que le critère BIC peut être utilisé pour sélectionner le paramètre de régularisation optimal.

Publications sélectionnées

Girka et al. (2026). Multiblock data analysis with the RGCCA package. Journal of Statistical Software, 1-36

Contact


Arthur TENENHAUS

Professeur – CentraleSupélec

Signaux et statistiques – Signal & Stat

.

Bât. Breguet .