Skip to content

第三步:清洗数据

现在,你已经熟练构建模型了,是不是觉得很简单?但往往你拿到的数据不一定都是"干净的"——里面有传感器跳变、录入错误、以及真正 的工艺异常。接下来我们把这些"杂质"挑出来。

清洗有三条路径,可以组合使用:

路径适合谁入口
手工套索相信自己的眼睛,想逐点确认工具栏 → 套索 → 删数
算法检测想让算法先给个候选清单图表内的异常检测按钮
AI 自动清洗想一步到位拿到诊断报告AI 分析 → AI清洗

🎯 路径一:像玩游戏一样圈选异常 (Lasso)

如果你更相信自己的眼睛,试试我们的套索工具

lasso

  1. 打开模型视图内的一些图表,比如 T1-T2 关系图
  2. 看到那些红圈外离群很远的红点了吗?它们很可能就是异常值!
  3. 按住鼠标左键,画一个圈把它们套住。⭕️
  4. 松手!这些点就被"捕获"了,变成了红色选中状态。

🔴🔵 红蓝两组:顺手做对比分析

圈选第二组数据时,这批点会被标记为蓝色。红蓝两组是平台"对比分析"功能的基础:

  • 手工:用套索分别圈出红组与蓝组
  • 快捷:在图表或表格中用 Shift + 点击 选红组、Ctrl + 点击 选蓝组

选好两组后,点击工具栏的 对比分析,系统会自动生成一张包含差异分析贡献度指标的新图表。

💡 更进一步的用法:用 AI 对比分析 让大模型直接解读这两组到底差在哪、可能是什么原因。 详见 AI 智能能力总览


🔍 路径二:让算法先给候选清单

除了肉眼圈选,平台内置了两种无监督异常检测算法,可以先把可疑样本挑出来,再由你确认。

算法位置特点
孤立森林 (Isolation Forest)t1-t2 / 载荷图等散点图通过随机切分隔离样本,对全局离群点敏感
LOF(局部离群因子)预测散点图基于局部密度,对局部稀疏区域的样本更敏感

用法:在图表上方的工具栏点击对应按钮,检测完成后会提示:

  • 检测到 N 个异常点 —— 这些点会被高亮
  • 未检测到明显异常点 —— 当前图表数据分布正常

💡 两种算法结果不一致是正常的:孤立森林关注"整体上很偏",LOF 关注"在自己的邻域里很孤僻"。 两者都标记出来的样本,通常最值得优先排查。


🤖 路径三:交给 AI 自动清洗

入口:工具栏 AI 分析 → AI清洗

AI 会自动依次完成三件事:

  1. 分析模型指标 —— 读取 R²X、R²Y、Q²Y、组件数
  2. 生成多维图表 —— 自主决定该画哪些图辅助分析
  3. 诊断异常数据 —— 定位超限样本,自动用红圈高亮圈选,并逐条给出业务层面的可能原因

产出报告包含异常样本清单、根因推测与清洗建议,可导出 MarkdownWord 留存。

⚠️ AI 只负责"圈出来"和"给建议",不会自动删除任何数据——最终是否剔除由你决定。

详见 AI 智能能力总览


🗑️ 批量删除

圈选(或检测)完之后,点击工具栏的 删数 按钮。

  • 弹出一个对话框,点击仅显示选中,列出你刚才圈选的所有"坏蛋"。
  • 确认无误后,点击 "删除"

💥 砰!异常数据消失了!

💡 删除操作会创建一个新的过滤模型,原模型仍然保留在右侧模型列表中,不会被破坏——可以随时切回去对比。


🔄 删完之后:重新训练

删除异常样本后,按以下步骤让指标回升:

  1. 新生成的模型重命名(便于区分"清洗前 / 清洗后")
  2. 在右侧模型列表点击激活它(状态切换为 Active
  3. 点击 Fit 重新训练

然后对比两个模型的指标:

观察点说明
Q²Y 是否提升提升了 → 剔除的是真噪声;下降了 → 可能删掉了有用信息
R²Y 与 Q²Y 的差距是否缩小缩小 → 过拟合缓解
得分图是否更聚拢是 → 数据结构更清晰

💡 清洗是一个迭代过程:删数 → 重新 Fit → 再看图表 → 再删数。每轮都对比 Q²Y,直到指标不再明显改善。 注意不要"为了好看而删数"——把真实但不常见的工况删掉,模型上线后会失效。


⚖️ 三种路径怎么选

场景推荐路径
异常点数量少、位置明显手工套索
数据量大、肉眼找不过来算法检测(孤立森林 / LOF)
不熟悉数据、需要业务解释AI 自动清洗
需要向他人解释"为什么剔除"AI 自动清洗(报告可留存、可导出)

🔗 相关阅读

让数据说话,让决策更简单。