PaliSkill
Python avancé

Leçon 3 / 10 — Chapitre 10: Mise en pratique : pipeline d'analyse de données

Nettoyer et filtrer les données

Troisième étape : des données réelles contiennent souvent des valeurs manquantes ou invalides. .dropna() retire les lignes incomplètes ; un filtre (vu au sixième chapitre) élimine les valeurs incohérentes.

import pandas as pd

df = pd.DataFrame([
    {"produit": "riz", "montant": 25},
    {"produit": "huile", "montant": None},
    {"produit": "savon", "montant": -5},
])

df = df.dropna()
df = df[df["montant"] > 0]
print(df)

Ce code affiche uniquement la ligne riz : .dropna() retire d'abord huile (montant manquant, None devenu NaN dans le DataFrame), puis df[df["montant"] > 0] (vu au sixième chapitre) retire savon, dont le montant négatif n'a pas de sens pour une vente.

.dropna() accepte aussi subset=["colonne"], pour ne vérifier les valeurs manquantes que sur une colonne précise plutôt que sur l'ensemble du DataFrame :

df = df.dropna(subset=["montant"])

Nettoyer les données avant toute analyse (statistiques, tri, visualisation) évite que quelques valeurs incohérentes ne faussent les résultats — une moyenne calculée sur des montants négatifs ou manquants n'aurait aucun sens.

À vous de jouer : créez un DataFrame contenant une valeur manquante et une valeur négative, puis nettoyez-le avec .dropna() et un filtre.

🔒

Continuez ce module

Débloquez les leçons restantes ainsi que la certification finale.

2 500 XOF / 3,81 € / 4,15 $

Débloquez les 87 leçons restantes de ce module

Votre paiement est vérifié avant l'activation de l'accès