Skip to content

模型训练设置

平台的组件数是自动选的——点击 Fit 之后,系统会做交叉验证,自动找到最佳组件数。这套自动搜索的行为,可以通过全局模型训练设置来调节。

入口:顶部工具栏 → 设置 ⚙️ → 左侧菜单 模型训练设置

⚠️ 这里的设置是全局生效的,会影响之后所有模型的训练(对已训练完成的模型不追溯)。


🎛️ 七个参数

设置面板分为三组:验证参数 → PCA 阈值 → 监督模型阈值。所有参数修改后立即保存并提示「训练设置已更新」

第一组:验证与搜索控制

参数范围默认值含义
交叉验证折数 (CV_SPLITS)2 ~ 207用于评估模型预测性能的 K 折交叉验证次数
最大组件数上限 (MAX_COMPONENTS_LIMIT)1 ~ 10020算法硬性组件数上限,防止组件数过大导致内存爆掉或过度拟合
早停容忍度 (PATIENCE)1 ~ 102连续几次组件增加不达标则提前停止搜索

💡 三个参数怎么选?

  • 交叉验证折数:样本量大、想跑快一点 → 调低到 5;样本量小、想要更稳的 Q² → 调到 10 甚至更高。 折数越高,单次训练越慢。
  • 最大组件数上限:这是一个安全阀。默认 20 对绝大多数工业数据已足够——如果你的模型"想"用超过 20 个组件, 通常说明数据里噪声很大,而不是真的需要这么多组件。
  • 早停容忍度:调大(如 3~5)会让搜索更"执着",可能找到更晚出现的 Q² 峰值,但训练更慢;调小(1)则一旦没有提升就立刻停止。

第二组:PCA 阈值

参数默认值含义
PCA Q²X 阈值0.010PCA 降维去噪使用,要求至少提升多少解释率/预测率
PCA R²X 阈值0.010要求数据方差的解释率至少提升多少

💡 这两个阈值控制"什么时候该停下来"。默认 0.010 表示:新增一个主成分如果连 1% 的解释率提升都带不来,就不值得再要了。 想让 PCA 更精简 → 调大;想尽量保留信息 → 调小

第三组:监督模型阈值

参数默认值含义
PLS/OPLS 回归 Q²Y 阈值0.010用于连续变量预测,要求 Q²Y 至少提升多少
PLS-DA/OPLS-DA 分类 AUC 阈值0.005分类任务使用 AUC 作为核心指标,要求 AUC 至少提升多少

💡 注意分类任务的默认阈值更小(0.005):因为 AUC 的数值变动幅度天然比 Q²Y 小,用同样尺度会过早停止。


🧠 平台是怎么自动选组件数的

理解这几个参数的作用,需要先知道平台背后的搜索逻辑:

整个搜索由两个刹车控制:

  1. 早停容忍度 (PATIENCE) —— 连续 N 次没有明显提升就放弃
  2. 最大组件数上限 —— 硬性天花板,防止无限搜索

而"有没有明显提升"的判定标准,就是后四个阈值参数


🔧 常见调参场景

你遇到的现象调整建议
训练太慢,组件数选得太多调低 最大组件数上限(如 10)
每次 Fit 结果不稳定调高 交叉验证折数(如 10),让 Q² 估计更稳
最优组件数明显偏少,Q² 还有上升空间调低 Q²Y 阈值(如 0.005),让搜索更愿意继续
最优组件数偏多,疑似过拟合调高 Q²Y 阈值(如 0.02),提高"值得增加组件"的门槛
PCA 去噪不够调低 PCA R²X / Q²X 阈值,保留更多主成分
分类模型 AUC 卡在某个值上不去检查是否类别极不平衡,而非一味调阈值

⚠️ 调完记得重新 Fit:这些参数只影响之后的训练。已有模型需要点击 Fit(或 C+1 / C-1)重新拟合才会应用新设置。


🧩 训练设置 vs 手动 C+1 / C-1

两者是互补关系,不要混淆:

方式作用范围使用时机
训练设置(本页)全局、持久确定"自动搜索"的行为规则,属于一次性配置
C+1 / C-1(工具栏)单个模型、即时对某个具体模型做微调,观察 Q² 随组件数的变化

💡 推荐工作流:先用默认训练设置 Fit 出一个基线模型 → 用 C+1/C-1 手动探索组件数与 Q² 的关系 → 如果发现默认的自动选择总是"停得太早"或"走得太多",再回到训练设置里调整阈值。

⚠️ OPLS / OPLS-DA 特别注意:这两个模型的"组件数"是正交成分数,不是潜变量数(预测成分固定为 1 个)。 因此 最大组件数上限 对它们来说意味着"最多剥离多少层正交噪声",通常 1~3 就足够,不建议设得很大。 详见 核心模型算法详解


🔗 相关阅读

让数据说话,让决策更简单。