Leçon 4 / 10 — Chapitre 10: Mise en pratique : pipeline d'analyse de données
Calculer des statistiques avec groupby
Quatrième étape : résumer les ventes par catégorie, avec .groupby() (vu au sixième chapitre) — l'étape d'analyse proprement dite du pipeline, une fois les données chargées et nettoyées.
import pandas as pd
df = pd.DataFrame([
{"produit": "riz", "categorie": "alimentation", "montant": 25},
{"produit": "huile", "categorie": "alimentation", "montant": 40},
{"produit": "savon", "categorie": "hygiene", "montant": 15},
])
totaux = df.groupby("categorie")["montant"].sum()
print(totaux)
Ce code affiche alimentation 65 puis hygiene 15 : .groupby("categorie")["montant"].sum() (vu au sixième chapitre) additionne les montants au sein de chaque catégorie séparément.
.agg() (vu au sixième chapitre) calcule plusieurs statistiques à la fois, utile pour un résumé plus complet en une seule instruction :
resume = df.groupby("categorie")["montant"].agg(["sum", "mean", "count"])
print(resume)
Ce code affiche, pour chaque catégorie, le total, la moyenne et le nombre de ventes — un tableau de bord miniature, obtenu sans boucle explicite.
À vous de jouer : avec un DataFrame de ventes d'au moins deux catégories, calculez le total et la moyenne par catégorie avec .groupby() et .agg().
Continuez ce module
Débloquez les leçons restantes ainsi que la certification finale.
2 500 XOF / 3,81 € / 4,15 $
Débloquez les 87 leçons restantes de ce module
Votre paiement est vérifié avant l'activation de l'accès