Méthodes avancées de Data Mining
Objectifs pédagogiques
Faire le lien entre les méthodes de Data Mining usuelles et les méthodes issues de la recherche récente en apprentissage statistique, comme les méthodes à noyaux (SVM et SVR entre autres) et les méthodes d’agrégation (boosting, bagging, forêts aléatoires).
Savoir mettre en œuvre ces méthodes sur des cas pratiques et juger de leur pertinence en fonction de l’objectif recherché.
Thèmes abordés
La formation décrit les principales méthodes de data mining issues de la recherche actuelle en apprentissage statistique, cible leurs difficultés et leurs avantages et évalue leurs performances.
Des applications sur des jeux de données simulées et réelles seront mises en œuvre à l’aide du logiciel libre R et de Sas.
Statistique, apprentissage et data mining
- Définitions, positionnement
- Principales applications
- Panorama des méthodes et de l’offre logicielle
- Choix d’une méthode et ajustement des paramètres
Méthodes à noyaux, SVM et SVR
- Support Vector Machines pour la discrimination binaire ou multi-classes
- Support Vector Regression pour la régression
- Ajustement des paramètres
Méthodes d’agrégation et bootstrap
- Agrégation de règles de prédiction : intérêt
- Principe du bootstrap
- Méthodes de boosting (Adaboost et logitboost)
- Méthodes de bagging, forêts aléatoires
Prérequis
Notions statistiques de base, méthodes de discrimination usuelles (régression logistique, arbres de décision), régression linéaire.
Autres thèmes en intra — Data science & IA
- Introduction aux enjeux du Big Data en assurance 4 jours
- R pour la data science 3 jours
- Actuariat et Big Data : quels enjeux juridiques ? 1 jour
- Python pour la data science 3 jours
- MLOps : panorama et mise en place 1 jour
- Sécurisation des données 1 jour
- Web-Scraping : méthodes d'extraction de données sur le web 3 jours
- Réduction de dimension et classification non supervisée (Clustering) 1 jour