Web-Scraping : méthodes d'extraction de données sur le web
Objectifs pédagogiques
Acquérir les notions théoriques et pratiques nécessaires à la mise en œuvre des techniques d’acquisition automatisées de données sur le web.
Thèmes abordés
La formation se concentre sur les méthodes d’extraction de données structurées ou semi-structurées depuis une page web (“web scraping”) ou une interface de programmation. Chaque méthode fait l’objet d’une présentation théorique et d’exemples pratiques de programmation. La formation nécessite une connaissance de base en programmation.
Les droits d’utilisation des données disponibles sur le web 3h
Présentation des concepts de licences sur les données, du mouvement OpenData et des principales licences.
Récupérer des données fournies par une interface de programmation (API) 3h
Définition d’une API, requêtage, exemples pratiques avec Python et R.
Récupérer des données d’un site web 3h
Définition du web scraping, parcours de pages web, exemples pratiques avec Python et R, utilisation des Apis Web (Google, Twitter…)
Exemples d’outils pour faciliter le web scraping 1h
Outils pour extraire depuis des sites statiques ou sites fortement dynamiques (ajax): Scrapy, PhantomJS, etc.
Problèmes avancés d’extractions de données 2h
Ordonnancement, proxy, authentification, erreurs HTTP.
Public visé
Data analysts, data scientists.
Prérequis
Connaissances de base en traitement de données, programmation (idéalement en Python), notions de HTTP, HTML, CSS, XML, JSON, XPath, CSS selectors, regex.
Autres thèmes en intra — Data science & IA
- Introduction aux enjeux du Big Data en assurance 4 jours
- Méthodes avancées de Data Mining 2 jours
- R pour la data science 3 jours
- Actuariat et Big Data : quels enjeux juridiques ? 1 jour
- Python pour la data science 3 jours
- MLOps : panorama et mise en place 1 jour
- Sécurisation des données 1 jour
- Réduction de dimension et classification non supervisée (Clustering) 1 jour