Les fondamentaux de la statistique à l’ère de l’IA générative
Objectifs pédagogiques
- Maîtriser les concepts de la statistique descriptive afin de comprendre l’information statistique et d’éviter les pièges d’interprétation.
- Savoir réaliser des traitements simples sur des données et présenter les résultats obtenus à l’aide de tableaux, de graphiques et d’indicateurs numériques.
- Mesurer la liaison entre deux variables et discerner la pertinence des outils employés ainsi que leurs limites.
- S’approprier les indicateurs statistiques, de leur construction à leur bonne utilisation, afin de les intégrer dans des communications.
- Savoir mobiliser un assistant d’IA générative pour produire, mettre en forme et interpréter des tableaux et des graphiques, tout en gardant un regard critique sur les résultats fournis.
Programme détaillé
Construite à partir d’exemples pratiques, cette formation vise à comprendre, organiser, traiter, analyser et présenter l’information statistique. La formation a une orientation pratique forte, de nombreux exemples et des ateliers seront proposés avec Excel et avec des assistants d’IA générative.
Concepts de la statistique 1h
- Objectifs et démarche de l’analyse statistique
- Individu statistique, échantillon et population
- Typologie des variables : qualitatives (nominales, ordinales) et quantitatives (discrètes, continues) Description univariée des données : tableaux et représentations graphiques (4h)
- Construction et interprétation de tableaux statistiques pour les variables qualitatives et quantitatives
- Distributions d’effectifs, de fréquences et fréquences cumulées
- Représentations graphiques des distributions : diagrammes en barres, diagrammes en bâtons, histogrammes et diagrammes circulaires (« camemberts »)
Utilisation d’un assistant d’IA générative pour décrire des données 3h
- Principes de fonctionnement, capacités et limites des grands modèles de langage (LLM) appliqués à l’analyse de données
- Formulation de requêtes efficaces (« prompt engineering ») pour produire des tableaux statistiques, des indicateurs descriptifs et des représentations graphiques
- Génération assistée de commentaires statistiques et d’interprétations des résultats
- Vérification, validation et fiabilisation des résultats produits par l’IA générative
- Identification des erreurs, biais et hallucinations potentielles
Atelier
Résumé de l’information à l’aide d’indicateurs statistiques – Partie 1 6h
- Caractéristiques de tendance centrale : moyenne arithmétique, médiane, mode, autres moyennes, l’effet de structure
- Quantiles, boîte à moustaches (box-plot)
- Caractéristiques de dispersion : variance et écart-type, coefficient de variation, écart absolu médian, étendue, intervalles inter-quantiles
Atelier
Résumé de l’information à l’aide d’indicateurs statistiques – Partie 2 2h
- Caractéristiques de forme : aplatissement, asymétrie
- Étude de la concentration : courbe de Lorenz, indice de Gini
Atelier
Description et mesure de la liaison entre deux variables 8h
- Tableaux de contingence, distributions marginales et conditionnelles
- Graphiques conditionnels et exploration visuelle des dépendances entre variables
- Mesure de la liaison entre variables qualitatives : khi-deux et V de Cramer
- Mesure de la liaison entre variables quantitatives : corrélation linéaire, régression simple et corrélation de Spearman
- Moyennes, variances et distributions conditionnelles
- Rapport de corrélation et analyse de la variance à un facteur (ANOVA)
Atelier
Public visé
Toute personne souhaitant s’initier à la statistique afin d’acquérir un regard critique par rapport aux résultats statistiques. Une connaissance de base d’Excel est recommandée.
Prérequis
Aucun
Approche pédagogique
Calculés à partir de 20 avis recueillis depuis 07/07/2017, lors de 2 sessions de cette formation.
L'IA générative fait les calculs… mais qui vérifie ?
Demandez à un assistant d’IA générative de « décrire ce fichier » : en quelques secondes, vous obtenez un tableau, deux graphiques et un commentaire rédigé. Le résultat est fluide, présentable… et parfois faux. Une moyenne calculée sur une variable ordinale, un histogramme aux classes mal choisies, une corrélation présentée comme une causalité, un pourcentage qui n’existe dans aucune ligne du fichier : l’assistant ne signale rien, parce qu’il ne « sait » pas ce qu’est une donnée. C’est à vous de le savoir.
Ce que l’IA fait bien : la mise en forme et la vitesse. Produire un tableau croisé, tracer une boîte à moustaches, reformuler un résultat en phrase lisible, tester dix représentations graphiques en une minute. Sur ces tâches, elle fait gagner un temps considérable — à condition de savoir formuler la demande et de reconnaître une sortie correcte.
Ce que l’IA ne fait pas à votre place : choisir. Quelle variable est qualitative, laquelle est quantitative ? La médiane est-elle plus pertinente que la moyenne pour ces salaires ? Cet écart entre deux groupes est-il notable ou négligeable ? Un khi-deux a-t-il un sens sur ce tableau ? Ces décisions reposent sur les fondamentaux de la statistique descriptive — univariée (distributions, tendance centrale, dispersion, forme, concentration) puis bivariée (tableaux de contingence, corrélation, régression simple, rapport de corrélation) — et ce sont précisément eux que l’assistant ne maîtrise pas de façon fiable.
Pourquoi les deux ensemble : apprendre la statistique sans l’IA, c’est se priver d’un outil que vos collègues utilisent déjà ; utiliser l’IA sans la statistique, c’est signer des résultats qu’on ne peut pas défendre. La formation alterne donc les deux : chaque notion est d’abord travaillée « à la main » avec Excel, puis reproduite avec un assistant d’IA générative, pour comparer, repérer les écarts et comprendre d’où ils viennent — une hallucination, un biais du modèle, ou une question mal posée.
À l’issue de la formation, vous saurez produire vite grâce à l’IA et, surtout, relire ce qu’elle produit avec l’œil de quelqu’un qui connaît les règles du jeu. C’est ce regard critique, pas la vitesse, qui fait la différence dans une réunion.