Skip to content

模型探索与参数寻优 会员专享

恭喜你!模型训练好了,数据也清洗干净了。现在,让我们戴上侦探帽,拿上放大镜,进入模型探索 (Model Exploration) 的世界, 并且——直接让算法告诉你最优工艺参数该设多少。🕵️‍♂️

⚠️ 前置条件:必须先在右侧模型列表中已激活且已拟合 (Fit) 一个模型。

入口:顶部工具栏 → 展开【分析探索】下拉(放大镜图标)→ 模型探索


🗺️ 界面总览

模型探索是一个信息密度很高的"驾驶舱",分为六大区块:

┌─────────────────────────────────────────────────────────────┐
│  ① 坐标轴与模型指标  │  ② 散点图(探索/搜寻)  │ ③ T-Scores  │
├─────────────────────────────────────────────────────────────┤
│  ④ 3D 寻优曲面 (Loss Surface)                                │
├─────────────────────────────────────────────────────────────┤
│  ⑤ X-Space 特征空间        │  ⑥ Y-Space 目标空间              │
│      + Violations 边界违规                                    │
├─────────────────────────────────────────────────────────────┤
│  ⑦ Optimization 寻优面板                                     │
└─────────────────────────────────────────────────────────────┘

①② 散点图与两种模式

映入眼帘的是一张散点图,这就是你的"藏宝图"。每一个灰点都是你的一条历史数据。

  • 红圈 (Ellipse):那是安全的港湾(置信区间)。圈内是正常数据,圈外可能是"宝藏"也可能是"陷阱"(异常值)。
  • 红点 (Target):那是你正在探索的"位置"。

右上角可以在两种模式间切换:

🧭 探索模式 (Explore Mode):寻找最优解

想象一下,你正驾驶着一艘飞船在数据宇宙中穿梭。

  • 怎么玩? 直接用鼠标拖拽那个红点!
  • 有什么用? 当你移动红点时,你其实是在模拟:"如果我的数据点在这个位置(T1, T2 得分),那么它的原始特征 (X) 和预 测结果 (Y) 应该是多少?"
  • 背后发生了什么? 平台调用反向预测算法,从得分反算出原始变量取值。
  • 实时反馈:下方的 X-Space & Y-Space 面板会随着红点的移动实时跳动,告诉你当前位置下每一个变量(比如温度、压力、良品 率)的理论值是多少。

💡 这是"反向优化"的神器:把红点拖到良品率最高的那片区域,下面的 X-Space 就会告诉你此时的原料配比应该是多少!

🔍 搜寻模式 (Search Mode):时光回溯

  • 怎么玩? 红点不再听你指挥,而是变成点击选择。你可以点击图上任意一个灰色的历史点。
  • 有什么用? 当你点击某个点时,系统会瞬间"穿越"回那条数据产生的那一刻。
  • 真相大白:下方的面板会立即显示那条数据当时的所有真实数值

💡 典型用法:"上次那个异常批次到底发生了什么?" 在搜寻模式下点它一下,所有参数一目了然。


③ T-Scores 得分列表

右上角展示当前选中点在所有主成分上的具体得分值(t1, t2, t3 …)。

  • 探索模式下:显示红点当前位置的得分
  • 搜寻模式下:显示该历史样本的真实得分

④ 3D 寻优曲面 (Loss Surface)

散点图下方是一张 3D 响应曲面图

含义
X 轴t[xComponent](如 t1)
Y 轴t[yComponent](如 t2)
Z 轴Loss(损失值)

它把整个潜空间的"好坏程度"铺成一张立体的地形图——谷底就是最优区域

运行寻优后,曲面上还会叠加显示寻优路径(从起点走向最优解的轨迹),并与下方的回放控制条联动。


⑤⑥ X-Space 与 Y-Space:变量空间

这是探索模式最核心的输出面板。

面板内容
X-Space(特征空间)左边是你的配方(X 变量)。显示 Raw Value(真实物理值,如 100℃)与 Bounds(上下限)
Y-Space(目标空间)右边是你的目标(Y 变量)。显示预测值及其安全范围

📏 边界 (Bounds) 是怎么定的

平台默认采用两套边界,可分别开关切换:

边界类型规则
标准化边界± 1.5(标准化尺度)
原始边界均值 ± 1.5 × 标准差

超出范围的数值会进入报警区域 🚨。

🔧 把变量标记为 MV 或 DV

这是寻优功能的关键一步:点击变量旁边的标记,可以把它设置为:

标记全称含义
MVManipulated Variable操作变量——你可以主动调节的(如设定温度)
DVDisturbance Variable扰动变量——不可控但会影响结果的(如环境湿度)

💡 为什么必须标记? 寻优算法需要知道哪些变量可以调、哪些只能接受。如果误把 DV 标成 MV,算法会给出"去调环境湿度" 这种无法执行的建议。

变量分类的完整方法论见 工厂场景数据建模指南


⑦ Violations:边界违规实时清单

面板标题形如 Violations (N),实时列出当前点上所有违反边界约束的变量

  • 探索模式下拖动红点超出合理范围 → 这里会立即刷新
  • 每条记录会标明变量名与违反的是哪个边界

💡 它的实战价值:优化算法可能给出一个"数学上最优、物理上做不到"的点。Violations 就是你判断"这个建议到底能不能落地"的 第一道关卡——如果清单很长,说明这个最优解在现实中很难实现


🚀 Optimization:寻优引擎

最下方是 Optimization 面板,负责自动求解最优参数。

参数设置

参数范围/步长含义
Max Iter1 ~ 1000最大迭代次数,控制搜索的"耐心"
Tol步长约 1e-6收敛容差,越小越精确但越慢

运行

点击 Run Optimization,算法会自动搜索并给出最优解与完整的寻优路径轨迹

完成后状态栏显示:

  • Optimization Converged —— 成功收敛
  • Optimization Failed: <原因> —— 未收敛(可尝试放宽 Tol 或增大 Max Iter)

路径回放

得到结果后,面板下方出现回放控制条

  • ▶️ / ⏸️ 播放暂停按钮 —— 自动播放整个寻优过程
  • 滑块 —— 手动拖到任意一步
  • 步数标签 —— 形如 12 / 48,当前步 / 总步数

回放时,散点图上的红点、3D 曲面上的路径、以及 X/Y-Space 的数值会同步变化,你能清楚看到算法是"怎么一步步走到最优解"的。

💡 回放不只是好看:它能帮你判断算法是否"走偏了"。如果路径绕了一大圈才到终点,说明这个最优解对参数很敏感, 实际生产中的鲁棒性可能不佳。


🧠 配套功能:因果推断 (DML)

位置:同一个【分析探索】下拉菜单 → 因果推断 (DML)

⚠️ 相关性 ≠ 因果性。前面所有分析(VIP、SHAP、相关系数)告诉你的都是"谁和谁一起变",而不是"改变谁能让结果变好"。 DML 就是用来跨越这条鸿沟的。

使用方式

界面提供三个选择器:

选择器含义
结果变量 (Y - Outcome)你想改善的那个指标
干预变量 (T - Treatment)你打算去"动"的那个变量
混淆特征库 (W - Confounders)需要控制住的其他变量(防止伪相关)

配置完成后点击 运行因果推断引擎

💡 典型问题:"提高反应温度,真的能提升收率吗?还是说温度高只是因为原料更好?" DML 通过双重机器学习剥离混淆因素,给出更接近因果的效应估计。


🎯 完整实战流程

1. Fit 一个 PLS / OPLS 模型

2. 进入「模型探索」

3. 在 X-Space 中把可调的变量标记为 MV,不可控的标为 DV

4. 运行 Optimization(Max Iter / Tol 按需调整)

5. 回放寻优路径,确认算法没有走偏

6. 检查 Violations:最优解的变量是否都在物理可行范围内?

7. 读 X-Space 的 Raw Value → 这就是推荐工艺参数

8. 若对因果关系存疑 → 用「因果推断 (DML)」进一步验证

9. 落地试生产,采集新数据,回到第 1 步迭代

⚠️ 使用注意

  • 探索结果是"模型认为"的最优,不是"现实一定可行"——务必结合 Violations 与工艺常识判断
  • 外推有风险:把红点拖到远离历史数据的区域,模型预测可信度会显著下降
  • DV 标记要准确:标记错了会导致寻优建议无法执行
  • 需要时序信息时:滞后类分析要求模型在训练时选择了「不随机」划分,详见 滞后影响分析

🔗 相关阅读

让数据说话,让决策更简单。