01 75 60 34 00 | conseil@ensae.fr | Prenez RDV |

Les fondamentaux de la statistique à l’ère de l’IA générative

Les fondamentaux de la statistique à l’ère de l’IA générative

Objectifs pédagogiques

  • Maîtriser les concepts de la statistique descriptive afin de comprendre l’information statistique et d’éviter les pièges d’interprétation.
  • Savoir réaliser des traitements simples sur des données et présenter les résultats obtenus à l’aide de tableaux, de graphiques et d’indicateurs numériques.
  • Mesurer la liaison entre deux variables et discerner la pertinence des outils employés ainsi que leurs limites.
  • S’approprier les indicateurs statistiques, de leur construction à leur bonne utilisation, afin de les intégrer dans des communications.
  • Savoir mobiliser un assistant d’IA générative pour produire, mettre en forme et interpréter des tableaux et des graphiques, tout en gardant un regard critique sur les résultats fournis.

Programme détaillé

Construite à partir d’exemples pratiques, cette formation vise à comprendre, organiser, traiter, analyser et présenter l’information statistique. La formation a une orientation pratique forte, de nombreux exemples et des ateliers seront proposés avec Excel et avec des assistants d’IA générative.

Concepts de la statistique 1h

  • Objectifs et démarche de l’analyse statistique
  • Individu statistique, échantillon et population
  • Typologie des variables : qualitatives (nominales, ordinales) et quantitatives (discrètes, continues) Description univariée des données : tableaux et représentations graphiques (4h)
  • Construction et interprétation de tableaux statistiques pour les variables qualitatives et quantitatives
  • Distributions d’effectifs, de fréquences et fréquences cumulées
  • Représentations graphiques des distributions : diagrammes en barres, diagrammes en bâtons, histogrammes et diagrammes circulaires (« camemberts »)

Utilisation d’un assistant d’IA générative pour décrire des données 3h

  • Principes de fonctionnement, capacités et limites des grands modèles de langage (LLM) appliqués à l’analyse de données
  • Formulation de requêtes efficaces (« prompt engineering ») pour produire des tableaux statistiques, des indicateurs descriptifs et des représentations graphiques
  • Génération assistée de commentaires statistiques et d’interprétations des résultats
  • Vérification, validation et fiabilisation des résultats produits par l’IA générative
  • Identification des erreurs, biais et hallucinations potentielles

Atelier

Résumé de l’information à l’aide d’indicateurs statistiques – Partie 6h

  • Caractéristiques de tendance centrale : moyenne arithmétique, médiane, mode, autres moyennes, l’effet de structure
  • Quantiles, boîte à moustaches (box-plot)
  • Caractéristiques de dispersion : variance et écart-type, coefficient de variation, écart absolu médian, étendue, intervalles inter-quantiles

Atelier

Résumé de l’information à l’aide d’indicateurs statistiques – Partie 2h

  • Caractéristiques de forme : aplatissement, asymétrie
  • Étude de la concentration : courbe de Lorenz, indice de Gini

Atelier

Description et mesure de la liaison entre deux variables 8h

  • Tableaux de contingence, distributions marginales et conditionnelles
  • Graphiques conditionnels et exploration visuelle des dépendances entre variables
  • Mesure de la liaison entre variables qualitatives : khi-deux et V de Cramer
  • Mesure de la liaison entre variables quantitatives : corrélation linéaire, régression simple et corrélation de Spearman
  • Moyennes, variances et distributions conditionnelles
  • Rapport de corrélation et analyse de la variance à un facteur (ANOVA)

Atelier

Public visé

Toute personne souhaitant s’initier à la statistique afin d’acquérir un regard critique par rapport aux résultats statistiques. Une connaissance de base d’Excel est recommandée.

Prérequis

Aucun

Approche pédagogique

Moyens pédagogiques
Exposé théorique de concepts Démonstration Applications pratiques sur ordinateur Étude de cas concrets Échanges sur les pratiques et expériences des participants Suivi pédagogique individualisé Temps de questions / réponses Exercices, quiz, forum, etc.
Méthodes pédagogiques
Méthode expositive Méthode démonstrative Méthode interrogative Méthode active

Indicateurs de satisfaction

Calculés à partir de 20 avis recueillis depuis 07/07/2017, lors de 2 sessions de cette formation.

Satisfaction globale
★★★★★ ★★★★★
4,5/5
Contenu
★★★★★ ★★★★★ 4,3/5
Durée et rythme
★★★★★ ★★★★★ 4,0/5
Formateur
★★★★★ ★★★★★ 4,7/5
Supports et ressources
★★★★★ ★★★★★ 4,7/5

Les objectifs de cette formation : statistique descriptive univariée et bivariée

La statistique descriptive univariée est une branche de la statistique qui vise à résumer, organiser et présenter des données de manière significative. Elle se concentre sur l’analyse d’une seule variable à la fois et comprend les éléments suivants :

Distribution des données : La statistique descriptive permet de visualiser la distribution des données à l’aide d’histogrammes, de boxplots, de diagrammes circulaires, etc.

  • Mesures de tendance centrale : Les mesures de tendance centrale, telles que la moyenne, la médiane et le mode, permettent de décrire où se situe le centre de la distribution des données.

  • Quantiles : Ce sont les valeurs de la variable qui divisent le jeu de données en intervalles contenant le même nombre de données. Les plus utilisés sont les quartiles, les déciles et les centiles (ou percentiles).

  • Mesures de dispersion : Les mesures de dispersion, comme l’écart-type, l’écart interquartile et l’étendue, fournissent des informations sur la variation des données autour de la mesure de tendance centrale.

La statistique bivariée concerne l’analyse de la relation entre deux variables. Elle permet d’explorer les liens et les interactions entre ces variables. Voici quelques éléments clés de la statistique bivariée :

  • Diagramme de dispersion : Le diagramme de dispersion (scatter plot ou nuage de points) est un outil graphique qui représente les données dans le plan cartésien selon deux variables continues. Il permet de visualiser la relation entre les deux variables et d’identifier des schémas ou des tendances.

  • Régression linéaire simple : La corrélation linéaire mesure la relation linéaire entre deux variables continues. Le coefficient de corrélation de Pearson est souvent utilisé pour quantifier cette relation.

  • Tests d’indépendance : Les tests d’indépendance, tels que le test du chi-carré, évaluent s’il y a une association statistiquement significative entre deux variables catégorielles.

  • Analyse de la variance : La décomposition de la variance permet de calculer le rapport de corrélation. Cet indicateur mesure la proportion de la variance qui peut être expliquée par une autre variable pouvant être qualitative.

La statistique bivariée permet donc d’explorer et de comprendre les relations entre deux variables. Elle est utile pour identifier les dépendances, les tendances et les associations, ce qui contribue à une meilleure compréhension des phénomènes étudiés.