01 75 60 34 00 | conseil@ensae.fr | Prenez RDV |

Analyse et traitement des données manquantes

MéTHODES STATISTIQUES 2 jours (12 h) Intermédiaire 1 140 € HT
Prochaine session 17 et 18 sept. 2026 Session garantie
S'inscrire
Analyse et traitement des données manquantes

Objectifs pédagogiques

  • Visualiser un dispositif de données manquantes
  • Imputer un tableau incomplet
  • Modéliser avec des données manquantes
  • Mettre en œuvre des méthodes de traitement de données manquantes sous R.

Programme détaillé

Cette formation vise à comprendre et savoir mettre en œuvre sous R une méthodologie adaptée face à un tableau de données incomplet. Plus précisément, après avoir vu les dangers de stratégies simplistes comme la suppression d’individus ou l’imputation par la moyenne, savoir visualiser un dispositif de données manquantes puis visualiser par ACP ou ACM un tableau incomplet avant de l’imputer pour mettre en œuvre des méthodes statistiques comme la modélisation.

Typologie, visualisation et fondamentaux du traitement des données manquantes 6h

  • Introduction à la problématique
  • Manipulation des données manquantes avec R et dplyr
  • Typologie des données manquantes (MCAR, MAR, MNAR)
  • Visualisation du dispositif de données manquantes : packages naniar, vim, ggplot, visu avec une ACM
  • Traitement des données manquantes par des méthodes d’imputation simple

Travaux pratiques avec les packages R suivants : mice, missForest et missMDA

Techniques avancées de traitement des données manquantes 6h

  • Imputation de tableaux avec des variables qualitatives ou mixtes
  • Imputation multiple : enjeux, méthodes de génération de tableaux multiple, modélisation
  • Rapide discussion sur des méthodes spécifiques : échantillonnage, données temporelles

Travaux pratiques avec les packages R suivants : mice, Amelia, missForest et missMDA

Public visé

Data analysts, chargés d’études statistiques, data scientists

Prérequis

Connaissances de base en statistiques descriptives (formation Statistiques descriptives avec R), connaissances de base du logiciel R (formation R initiation)

Connaissances des méthodes d’analyse exploratoires des données (ACP, ACM), des méthodes de régression et de machine learning.

Approche pédagogique

Moyens pédagogiques
Exposé théorique de concepts Applications pratiques sur ordinateur Échanges sur les pratiques et expériences des participants Temps de questions / réponses
Méthodes pédagogiques
Méthode expositive Méthode active

Pour aller plus loin

Les principales approches pour traiter les valeurs manquantes dans les données statistiques sont les suivantes. Vous les mettrez en oeuvre en langage R tout au long de la formation au moyen de packages tels que dplyrn, naniar, vim, ggplot, mice, melia, missForest et missMDA :

  • Suppression des valeurs manquantes : Cette approche consiste à supprimer toutes les observations qui contiennent des valeurs manquantes. Cela peut être approprié lorsque les valeurs manquantes sont aléatoires et que la perte de données est négligeable. Cependant, cette méthode peut entraîner une perte d’informations si les données manquantes ne sont pas complètement aléatoires.

  • Imputation simple : L’imputation simple implique la substitution des valeurs manquantes par une seule valeur, souvent basée sur une mesure résumée telle que la moyenne, la médiane ou le mode des données non manquantes. Cela peut être utilisé lorsque les données manquantes sont supposées être “ignorables” et que la valeur imputée ne biaisera pas les analyses ultérieures.

  • Imputation par méthode de régression : Cette méthode consiste à prédire les valeurs manquantes à l’aide d’un modèle de régression basé sur les autres variables de la dataset. On utilise généralement une régression linéaire ou une régression logistique pour prédire les valeurs manquantes en fonction des autres variables explicatives. Cette méthode est plus avancée mais peut produire des estimations plus précises si les variables utilisées pour la prédiction sont corrélées avec les variables manquantes.

  • Imputation par méthodes statistiques : Il existe plusieurs méthodes statistiques pour imputer les valeurs manquantes, telles que l’imputation par chaînes de Markov, l’imputation par équations d’estimation, l’imputation multiple et l’imputation basée sur la méthode Expectation-Maximization (EM). Ces méthodes tiennent compte de la structure des données et des relations entre les variables pour imputer les valeurs manquantes de manière plus précise.

  • Imputation basée sur les modèles : Cette approche consiste à utiliser des modèles plus complexes, tels que les modèles de régression multiple, les modèles linéaires généralisés ou les modèles non linéaires, pour imputer les valeurs manquantes. Les modèles sont ajustés sur les données non manquantes, puis utilisés pour prédire les valeurs manquantes.

Le choix de la méthode d’imputation va avant tout dépendre du contexte dans lequel ont été récoltées les données, des raisons impliquantes les valeurs manquantes et des objectifs de l’analyse statistique menée. Il sera bien sûr recommandé d’évaluer l’impact des différentes méthodes d’imputation sur les résultats des analyses afin de sélectionner la méthode la plus appropriée.