⚠️ 本文为 AI 生成的测试文章,仅用于演示与测试主题功能(排版、代码折叠、目录等),内容均为虚构。

为什么需要数据清洗

原始数据往往包含缺失值和异常值,直接分析会得出错误结论。

1
2
3
4
5
6
import pandas as pd

df = pd.read_csv("raw.csv")
df["age"] = df["age"].where(df["age"] > 0)
df = df.dropna(subset=["age", "score"])
print(df.describe())

缺失值处理

删除、填补或标记缺失,需要根据业务场景谨慎选择。

异常值的识别

可以使用箱线图或 Z 分数来辅助判断。

建议

分析前先探索,再建模。