Leçon 3 / 10 — Chapitre 10: Mise en pratique : pipeline d'analyse de données
Nettoyer et filtrer les données
Troisième étape : des données réelles contiennent souvent des valeurs manquantes ou invalides. .dropna() retire les lignes incomplètes ; un filtre (vu au sixième chapitre) élimine les valeurs incohérentes.
import pandas as pd
df = pd.DataFrame([
{"produit": "riz", "montant": 25},
{"produit": "huile", "montant": None},
{"produit": "savon", "montant": -5},
])
df = df.dropna()
df = df[df["montant"] > 0]
print(df)
Ce code affiche uniquement la ligne riz : .dropna() retire d'abord huile (montant manquant, None devenu NaN dans le DataFrame), puis df[df["montant"] > 0] (vu au sixième chapitre) retire savon, dont le montant négatif n'a pas de sens pour une vente.
.dropna() accepte aussi subset=["colonne"], pour ne vérifier les valeurs manquantes que sur une colonne précise plutôt que sur l'ensemble du DataFrame :
df = df.dropna(subset=["montant"])
Nettoyer les données avant toute analyse (statistiques, tri, visualisation) évite que quelques valeurs incohérentes ne faussent les résultats — une moyenne calculée sur des montants négatifs ou manquants n'aurait aucun sens.
À vous de jouer : créez un DataFrame contenant une valeur manquante et une valeur négative, puis nettoyez-le avec .dropna() et un filtre.
Continuez ce module
Débloquez les leçons restantes ainsi que la certification finale.
2 500 XOF / 3,81 € / 4,15 $
Débloquez les 87 leçons restantes de ce module
Votre paiement est vérifié avant l'activation de l'accès