Python pour la data science
Objectifs pédagogiques
- Se familiariser avec les environnements de développement en Python
- Acquérir les bases de la programmation en Python pour traiter, visualiser et modéliser les données.
Thèmes abordés
Python s’impose comme un des principaux langages pour la data science. Sa simplicité d’utilisation et sa capacité à s’intégrer à des infrastructures techniques robustes en font un choix de prédilection pour les big data.
Au travers d’IPython (version pour l’analyse interactive de Python) 3h
- Les différents environnements de développement
- L’utilisation des notebooks
Les bases de Python 3h
- Organisation d’un programme
- Types de données simples et complexes, List
Compréhension 3h
- Structures de contrôle
- Gestion des fichiers
- Principaux modules et fonctions
Préparation des données avec pandas 3h
- Lecture et écriture des données depuis et vers différentes sources (fichiers textes, Excel, bases de données, etc.)
- Filtrage, sélection, transformation, calcul, agrégation, jointure, sorties simples
La visualisation de données avec matplotlib & seaborn 2h
- Revue des différents types de graphiques
Apprentissage et analyse statistique avec sci-kit learn & statsmodels 3h
- Revue des techniques
- Gestion des ensembles d’apprentissage et de test
- Évaluation des modèles
Introduction à l’utilisation de Spark avec Python (pyspark) 1h
Public visé
Data analysts
Prérequis
- Connaissances de base en statistiques descriptives (formation Statistiques descriptives avec Python).
- Connaissances de base en statistique inférentielle (formation Statistique inférentielle : estimation ponctuelle, intervalle de confiance et test statistique).
- Connaissances intermédiaires de Python (formation Python intermédiaire).
Autres thèmes en intra — Data science & IA
- Introduction aux enjeux du Big Data en assurance 4 jours
- Méthodes avancées de Data Mining 2 jours
- R pour la data science 3 jours
- Actuariat et Big Data : quels enjeux juridiques ? 1 jour
- MLOps : panorama et mise en place 1 jour
- Sécurisation des données 1 jour
- Web-Scraping : méthodes d'extraction de données sur le web 3 jours
- Réduction de dimension et classification non supervisée (Clustering) 1 jour