第三步:清洗数据
现在,你已经熟练构建模型了,是不是觉得很简单?但往往你拿到的数据不一定都是"干净的"——里面有传感器跳变、录入错误、以及真正 的工艺异常。接下来我们把这些"杂质"挑出来。
清洗有三条路径,可以组合使用:
| 路径 | 适合谁 | 入口 |
|---|---|---|
| 手工套索 | 相信自己的眼睛,想逐点确认 | 工具栏 → 套索 → 删数 |
| 算法检测 | 想让算法先给个候选清单 | 图表内的异常检测按钮 |
| AI 自动清洗 | 想一步到位拿到诊断报告 | AI 分析 → AI清洗 |
🎯 路径一:像玩游戏一样圈选异常 (Lasso)
如果你更相信自己的眼睛,试试我们的套索工具。

- 打开模型视图内的一些图表,比如 T1-T2 关系图。
- 看到那些红圈外离群很远的红点了吗?它们很可能就是异常值!
- 按住鼠标左键,画一个圈把它们套住。⭕️
- 松手!这些点就被"捕获"了,变成了红色选中状态。
🔴🔵 红蓝两组:顺手做对比分析
圈选第二组数据时,这批点会被标记为蓝色。红蓝两组是平台"对比分析"功能的基础:
- 手工:用套索分别圈出红组与蓝组
- 快捷:在图表或表格中用 Shift + 点击 选红组、Ctrl + 点击 选蓝组
选好两组后,点击工具栏的 对比分析,系统会自动生成一张包含差异分析与贡献度指标的新图表。
💡 更进一步的用法:用 AI 对比分析 让大模型直接解读这两组到底差在哪、可能是什么原因。 详见 AI 智能能力总览。
🔍 路径二:让算法先给候选清单
除了肉眼圈选,平台内置了两种无监督异常检测算法,可以先把可疑样本挑出来,再由你确认。
| 算法 | 位置 | 特点 |
|---|---|---|
| 孤立森林 (Isolation Forest) | t1-t2 / 载荷图等散点图 | 通过随机切分隔离样本,对全局离群点敏感 |
| LOF(局部离群因子) | 预测散点图 | 基于局部密度,对局部稀疏区域的样本更敏感 |
用法:在图表上方的工具栏点击对应按钮,检测完成后会提示:
检测到 N 个异常点—— 这些点会被高亮未检测到明显异常点—— 当前图表数据分布正常
💡 两种算法结果不一致是正常的:孤立森林关注"整体上很偏",LOF 关注"在自己的邻域里很孤僻"。 两者都标记出来的样本,通常最值得优先排查。
🤖 路径三:交给 AI 自动清洗
入口:工具栏 AI 分析 → AI清洗
AI 会自动依次完成三件事:
- 分析模型指标 —— 读取 R²X、R²Y、Q²Y、组件数
- 生成多维图表 —— 自主决定该画哪些图辅助分析
- 诊断异常数据 —— 定位超限样本,自动用红圈高亮圈选,并逐条给出业务层面的可能原因
产出报告包含异常样本清单、根因推测与清洗建议,可导出 Markdown 或 Word 留存。
⚠️ AI 只负责"圈出来"和"给建议",不会自动删除任何数据——最终是否剔除由你决定。
详见 AI 智能能力总览。
🗑️ 批量删除
圈选(或检测)完之后,点击工具栏的 删数 按钮。
- 弹出一个对话框,点击仅显示选中,列出你刚才圈选的所有"坏蛋"。
- 确认无误后,点击 "删除"。
💥 砰!异常数据消失了!
💡 删除操作会创建一个新的过滤模型,原模型仍然保留在右侧模型列表中,不会被破坏——可以随时切回去对比。
🔄 删完之后:重新训练
删除异常样本后,按以下步骤让指标回升:
- 为新生成的模型重命名(便于区分"清洗前 / 清洗后")
- 在右侧模型列表点击激活它(状态切换为 Active)
- 点击 Fit 重新训练
然后对比两个模型的指标:
| 观察点 | 说明 |
|---|---|
| Q²Y 是否提升 | 提升了 → 剔除的是真噪声;下降了 → 可能删掉了有用信息 |
| R²Y 与 Q²Y 的差距是否缩小 | 缩小 → 过拟合缓解 |
| 得分图是否更聚拢 | 是 → 数据结构更清晰 |
💡 清洗是一个迭代过程:删数 → 重新 Fit → 再看图表 → 再删数。每轮都对比 Q²Y,直到指标不再明显改善。 注意不要"为了好看而删数"——把真实但不常见的工况删掉,模型上线后会失效。
⚖️ 三种路径怎么选
| 场景 | 推荐路径 |
|---|---|
| 异常点数量少、位置明显 | 手工套索 |
| 数据量大、肉眼找不过来 | 算法检测(孤立森林 / LOF) |
| 不熟悉数据、需要业务解释 | AI 自动清洗 |
| 需要向他人解释"为什么剔除" | AI 自动清洗(报告可留存、可导出) |