Python pour le big data

Data Value

Non finançable CPF
Tout public
Présentiel
Public admis
Salarié en poste
Demandeur d'emploi
Entreprise
Etudiant
Prix
Nous contacter
Durée
Nous contacter
Niveau visé
Non diplômante
Localité
En présentiel
Découvrez les localités disponibles pour suivre cette formation en présentiel.
En savoir plus sur les localités en présentiel
Cette formation est disponible dans les centres de formation suivants:
  • 69 - Lyon 2e
Cette formation peut être dispensée dans votre entreprise dans les localités suivantes :
  • 01 - Ain
  • 03 - Allier
  • 07 - Ardèche
  • 15 - Cantal
  • 26 - Drôme
  • 38 - Isère
  • 42 - Loire
  • 43 - Haute-Loire
  • 63 - Puy-de-Dôme
  • 69 - Rhône
  • 73 - Savoie
  • 74 - Haute-Savoie
Objectifs


Utiliser le langage Python pour manipuler et visualiser de grands ensembles de données (big data) en exploitant ses nombreuses librairies scientifiques
Programme
- Concepts du Big Data

  • Cette introduction permet de vous initier à la problématique du Big Data

  • Volume, Vitesse, Véracité

  • Map Reduce

  • Architecture Big Data et Data Lake

  • Big Data et Cloud computing

  • Les outils du Big Data

- Introduction à la librairie Dask


  • Dask est une librairie qui permet de faire du calcul distribué sur plusieurs cœurs ou plusieurs machines avec la possibilité d'utiliser un scheduler. Dask peut donc accélérer le calcul sur de larges volumes de données.

  • Présentation de Dask

  • Exemple de calculs distribués

  • Dask et Numpy : comparaison de performances

  • Dask et Pandas

- Introduction à la librairie Xarray


  • Xarray est une librairie Python qui s'appuie sur Numpy et permet de manipuler de larges volumes de données. Cette librairie est particulièrement efficace pour des fichiers netCDF et peut s'utiliser de concert avec Dask

  • Présentation de Xarray

  • Exemples d'utilisation de Xarray

  • Mise en pratique avec un fichier netCDF

- Introduction à la librairie Vaex


  • Vaex est une librairie qui ressemble beaucoup à pandas mais qui fait des calculs à la volée sans gaspiller l'usage de la RAM. On peut dès lors traiter des données qui ont près de 1 milliard de lignes à la seconde.

  • Présentation de Vaex

  • Prise en main de Vaex avec des exemples

  • Comparaison entre Vaex et Pandas

  • Visualisation des données avec Vaex

- Introduction à Spark


  • Spark est un outil permettant le passage à l'échelle pour la gestion des données et le calcul distribué. Bien que géré par Apache, Spark est en Open Source et peut s'utiliser avec plusieurs langages dont Python

  • Présentation de Spark

  • Architecture Apache Spark

  • Autres outils associés à Spark (Yarn, Mesos)

  • Resilient Distributed Dataset (RDD)

  • Présentation et Installation de PySpark

- Introduction à PySpark


  • Vous verrez grâce une mise en pratique sur une journée la prise en main de PySpark, comment lire et gérer des données, comment appliquer des fonctions sur les données et comment appliquer une réduction de dimension

- Visualisation des données massives avec Holoviews


  • Manipuler des gros volumes de données n'est pas toujours suffisants, on veut pouvoir aussi les visualiser. La librairie Holoviews permet aussi bien de transformer des données massives que de les visualiser.

  • Présentation et prise en main d'Holoviews

  • Interactivité avec Holoviews

Envie d’en savoir plus sur cette formation ?

Documentez-vous sur la formation

Ces formations peuvent vous intéresser

Quelle est votre situation ?

Vous êtes ?

Veuillez choisir un lieu

Please fill out this field.

Please fill out this field.

Veuillez sélectionner un niveau de formation

Informez-vous gratuitement et sans engagement sur la formation.

Please fill out this field.

Please fill out this field.

Please fill out this field.

Veuillez saisir une adresse email

  • Vous voulez dire ?
  • ou plutôt ?

En cliquant sur "J'envoie ma demande", vous acceptez les CGU et déclarez avoir pris connaissance de la politique de protection des données du site maformation.fr

Haut de page