PaliSkill
Python avancé

Leçon 4 / 10 — Chapitre 10: Mise en pratique : pipeline d'analyse de données

Calculer des statistiques avec groupby

Quatrième étape : résumer les ventes par catégorie, avec .groupby() (vu au sixième chapitre) — l'étape d'analyse proprement dite du pipeline, une fois les données chargées et nettoyées.

import pandas as pd

df = pd.DataFrame([
    {"produit": "riz", "categorie": "alimentation", "montant": 25},
    {"produit": "huile", "categorie": "alimentation", "montant": 40},
    {"produit": "savon", "categorie": "hygiene", "montant": 15},
])

totaux = df.groupby("categorie")["montant"].sum()
print(totaux)

Ce code affiche alimentation 65 puis hygiene 15 : .groupby("categorie")["montant"].sum() (vu au sixième chapitre) additionne les montants au sein de chaque catégorie séparément.

.agg() (vu au sixième chapitre) calcule plusieurs statistiques à la fois, utile pour un résumé plus complet en une seule instruction :

resume = df.groupby("categorie")["montant"].agg(["sum", "mean", "count"])
print(resume)

Ce code affiche, pour chaque catégorie, le total, la moyenne et le nombre de ventes — un tableau de bord miniature, obtenu sans boucle explicite.

À vous de jouer : avec un DataFrame de ventes d'au moins deux catégories, calculez le total et la moyenne par catégorie avec .groupby() et .agg().

🔒

Continuez ce module

Débloquez les leçons restantes ainsi que la certification finale.

2 500 XOF / 3,81 € / 4,15 $

Débloquez les 87 leçons restantes de ce module

Votre paiement est vérifié avant l'activation de l'accès