模型探索与参数寻优 会员专享
恭喜你!模型训练好了,数据也清洗干净了。现在,让我们戴上侦探帽,拿上放大镜,进入模型探索 (Model Exploration) 的世界, 并且——直接让算法告诉你最优工艺参数该设多少。🕵️♂️
⚠️ 前置条件:必须先在右侧模型列表中已激活且已拟合 (Fit) 一个模型。
入口:顶部工具栏 → 展开【分析探索】下拉(放大镜图标)→ 模型探索
🗺️ 界面总览
模型探索是一个信息密度很高的"驾驶舱",分为六大区块:
┌─────────────────────────────────────────────────────────────┐
│ ① 坐标轴与模型指标 │ ② 散点图(探索/搜寻) │ ③ T-Scores │
├─────────────────────────────────────────────────────────────┤
│ ④ 3D 寻优曲面 (Loss Surface) │
├─────────────────────────────────────────────────────────────┤
│ ⑤ X-Space 特征空间 │ ⑥ Y-Space 目标空间 │
│ + Violations 边界违规 │
├─────────────────────────────────────────────────────────────┤
│ ⑦ Optimization 寻优面板 │
└─────────────────────────────────────────────────────────────┘①② 散点图与两种模式
映入眼帘的是一张散点图,这就是你的"藏宝图"。每一个灰点都是你的一条历史数据。
- 红圈 (Ellipse):那是安全的港湾(置信区间)。圈内是正常数据,圈外可能是"宝藏"也可能是"陷阱"(异常值)。
- 红点 (Target):那是你正在探索的"位置"。
右上角可以在两种模式间切换:
🧭 探索模式 (Explore Mode):寻找最优解
想象一下,你正驾驶着一艘飞船在数据宇宙中穿梭。
- 怎么玩? 直接用鼠标拖拽那个红点!
- 有什么用? 当你移动红点时,你其实是在模拟:"如果我的数据点在这个位置(T1, T2 得分),那么它的原始特征 (X) 和预 测结果 (Y) 应该是多少?"
- 背后发生了什么? 平台调用反向预测算法,从得分反算出原始变量取值。
- 实时反馈:下方的 X-Space & Y-Space 面板会随着红点的移动实时跳动,告诉你当前位置下每一个变量(比如温度、压力、良品 率)的理论值是多少。
💡 这是"反向优化"的神器:把红点拖到良品率最高的那片区域,下面的 X-Space 就会告诉你此时的原料配比应该是多少!
🔍 搜寻模式 (Search Mode):时光回溯
- 怎么玩? 红点不再听你指挥,而是变成点击选择。你可以点击图上任意一个灰色的历史点。
- 有什么用? 当你点击某个点时,系统会瞬间"穿越"回那条数据产生的那一刻。
- 真相大白:下方的面板会立即显示那条数据当时的所有真实数值。
💡 典型用法:"上次那个异常批次到底发生了什么?" 在搜寻模式下点它一下,所有参数一目了然。
③ T-Scores 得分列表
右上角展示当前选中点在所有主成分上的具体得分值(t1, t2, t3 …)。
- 探索模式下:显示红点当前位置的得分
- 搜寻模式下:显示该历史样本的真实得分
④ 3D 寻优曲面 (Loss Surface)
散点图下方是一张 3D 响应曲面图:
| 轴 | 含义 |
|---|---|
| X 轴 | t[xComponent](如 t1) |
| Y 轴 | t[yComponent](如 t2) |
| Z 轴 | Loss(损失值) |
它把整个潜空间的"好坏程度"铺成一张立体的地形图——谷底就是最优区域。
运行寻优后,曲面上还会叠加显示寻优路径(从起点走向最优解的轨迹),并与下方的回放控制条联动。
⑤⑥ X-Space 与 Y-Space:变量空间
这是探索模式最核心的输出面板。
| 面板 | 内容 |
|---|---|
| X-Space(特征空间) | 左边是你的配方(X 变量)。显示 Raw Value(真实物理值,如 100℃)与 Bounds(上下限) |
| Y-Space(目标空间) | 右边是你的目标(Y 变量)。显示预测值及其安全范围 |
📏 边界 (Bounds) 是怎么定的
平台默认采用两套边界,可分别开关切换:
| 边界类型 | 规则 |
|---|---|
| 标准化边界 | ± 1.5(标准化尺度) |
| 原始边界 | 均值 ± 1.5 × 标准差 |
超出范围的数值会进入报警区域 🚨。
🔧 把变量标记为 MV 或 DV
这是寻优功能的关键一步:点击变量旁边的标记,可以把它设置为:
| 标记 | 全称 | 含义 |
|---|---|---|
| MV | Manipulated Variable | 操作变量——你可以主动调节的(如设定温度) |
| DV | Disturbance Variable | 扰动变量——不可控但会影响结果的(如环境湿度) |
💡 为什么必须标记? 寻优算法需要知道哪些变量可以调、哪些只能接受。如果误把 DV 标成 MV,算法会给出"去调环境湿度" 这种无法执行的建议。
变量分类的完整方法论见 工厂场景数据建模指南。
⑦ Violations:边界违规实时清单
面板标题形如 Violations (N),实时列出当前点上所有违反边界约束的变量。
- 探索模式下拖动红点超出合理范围 → 这里会立即刷新
- 每条记录会标明变量名与违反的是哪个边界
💡 它的实战价值:优化算法可能给出一个"数学上最优、物理上做不到"的点。Violations 就是你判断"这个建议到底能不能落地"的 第一道关卡——如果清单很长,说明这个最优解在现实中很难实现。
🚀 Optimization:寻优引擎
最下方是 Optimization 面板,负责自动求解最优参数。
参数设置
| 参数 | 范围/步长 | 含义 |
|---|---|---|
| Max Iter | 1 ~ 1000 | 最大迭代次数,控制搜索的"耐心" |
| Tol | 步长约 1e-6 | 收敛容差,越小越精确但越慢 |
运行
点击 Run Optimization,算法会自动搜索并给出最优解与完整的寻优路径轨迹。
完成后状态栏显示:
- ✅
Optimization Converged—— 成功收敛 - ❌
Optimization Failed: <原因>—— 未收敛(可尝试放宽 Tol 或增大 Max Iter)
路径回放
得到结果后,面板下方出现回放控制条:
- ▶️ / ⏸️ 播放暂停按钮 —— 自动播放整个寻优过程
- 滑块 —— 手动拖到任意一步
- 步数标签 —— 形如
12 / 48,当前步 / 总步数
回放时,散点图上的红点、3D 曲面上的路径、以及 X/Y-Space 的数值会同步变化,你能清楚看到算法是"怎么一步步走到最优解"的。
💡 回放不只是好看:它能帮你判断算法是否"走偏了"。如果路径绕了一大圈才到终点,说明这个最优解对参数很敏感, 实际生产中的鲁棒性可能不佳。
🧠 配套功能:因果推断 (DML)
位置:同一个【分析探索】下拉菜单 → 因果推断 (DML)
⚠️ 相关性 ≠ 因果性。前面所有分析(VIP、SHAP、相关系数)告诉你的都是"谁和谁一起变",而不是"改变谁能让结果变好"。 DML 就是用来跨越这条鸿沟的。
使用方式
界面提供三个选择器:
| 选择器 | 含义 |
|---|---|
| 结果变量 (Y - Outcome) | 你想改善的那个指标 |
| 干预变量 (T - Treatment) | 你打算去"动"的那个变量 |
| 混淆特征库 (W - Confounders) | 需要控制住的其他变量(防止伪相关) |
配置完成后点击 运行因果推断引擎。
💡 典型问题:"提高反应温度,真的能提升收率吗?还是说温度高只是因为原料更好?" DML 通过双重机器学习剥离混淆因素,给出更接近因果的效应估计。
🎯 完整实战流程
1. Fit 一个 PLS / OPLS 模型
↓
2. 进入「模型探索」
↓
3. 在 X-Space 中把可调的变量标记为 MV,不可控的标为 DV
↓
4. 运行 Optimization(Max Iter / Tol 按需调整)
↓
5. 回放寻优路径,确认算法没有走偏
↓
6. 检查 Violations:最优解的变量是否都在物理可行范围内?
↓
7. 读 X-Space 的 Raw Value → 这就是推荐工艺参数
↓
8. 若对因果关系存疑 → 用「因果推断 (DML)」进一步验证
↓
9. 落地试生产,采集新数据,回到第 1 步迭代⚠️ 使用注意
- 探索结果是"模型认为"的最优,不是"现实一定可行"——务必结合 Violations 与工艺常识判断
- 外推有风险:把红点拖到远离历史数据的区域,模型预测可信度会显著下降
- DV 标记要准确:标记错了会导致寻优建议无法执行
- 需要时序信息时:滞后类分析要求模型在训练时选择了「不随机」划分,详见 滞后影响分析
🔗 相关阅读
- 模型预测(含复制粘贴) —— 反向预测的兄弟功能:由 X 预测 Y
- 工厂场景数据建模指南 —— MV / DV / CV / PV 变量分类体系
- 工业控制系统与数据洞察平台 —— 寻优结果如何对接 APC/RTO
- S-Plot 标志物图 —— OPLS 模型下的标志物筛选