第四步:成果输出
模型训练好了,数据也清洗干净了,是时候把劳动成果带回家了!🎁
平台的导出能力分成四个方向:模型包、干净数据、分析报告、图表截图。下面逐个说明。
📦 出口一:下载在线模型包
位置:右侧模型列表中,当前模型下方的 下载在线模型包 按钮。
点击后,系统会把整个模型及其配套数据打包成一个文件:
- 文件名:
model_package_<模型ID>.dimod - 格式:
.dimod(平台的模型包格式,用于跨机器迁移/复用)
💡
.dimod与自定义下载的区别:.dimod是"整包搬走",用于在另一台装了星途平台的电脑上完整还原分析环境; 下面要讲的自定义下载导出的是 Python 可直接加载的.joblib/.pkl,用于脱离平台做二次开发。
⚠️ 授权限制
模型下载受授权控制。若遇到以下提示,说明当前授权不支持:
| 提示信息 | 原因 |
|---|---|
| 「未授权或授权已过期,无法下载模型」 | 授权失效 |
| 「当前授权不支持模型下载功能,请升级许可证」 | 授权未开通 下载权限 |
授权详情可在 底部状态栏 → 关于 / 授权信息 中查看,其中有一项 下载权限:允许 / 禁止。
🎛️ 出口二:自定义下载(推荐)
位置:右侧模型列表 → 自定义下载
这是平台最灵活的一项导出能力:你想带走什么,就勾什么。
第一步:选择下载格式
| 格式 | 说明 |
|---|---|
.joblib | Python 生态推荐格式,对 NumPy 数组序列化效率高 |
.pkl | Python pickle 标准格式,通用性最好 |
第二步:勾选下载内容
界面会以 JSON 结构预览的方式,直观展示整个模型包里有哪些键、各是什么类型:
{
"model": <sklearn 模型实例>, // 模型文件
"x_scaler": <StandardScaler>, // X归一化器
"y_scaler": <StandardScaler>, // Y归一化器
"y_binarizer": <LabelBinarizer>, // Y分类编码器
"train_data": <pandas.DataFrame>, // 训练集数据
"test_data": <pandas.DataFrame>, // 测试集数据
"full_data": <pandas.DataFrame>, // 完整数据集
"model_info": <dict>, // 模型元数据
"data_config": <dict> // 数据配置
}| 可选项 | 内容 | 什么时候需要 |
|---|---|---|
model | 训练好的核心模型实例(PCA/PLS/OPLS…) | 必选,没有它无法预测 |
x_scaler | X 的标准化器 | 用新数据预测时必须先做同样变换 |
y_scaler | Y 的标准化器 | 回归模型需用它把预测值还原回原量纲 |
y_binarizer | 类别编码器 | 仅判别模型(PLS-DA / OPLS-DA) |
train_data | 训练集 DataFrame | 需要复现训练过程 |
test_data | 测试集 DataFrame | 需要复现验证结果 |
full_data | 完整数据集 | 需要带着数据一起交付 |
model_info | 模型参数、训练指标、最优组件数等元数据 | 需要追溯模型配置 |
data_config | 列映射配置(哪些列是 X、哪个是 Y) | 需要知道原始列对应关系 |
💡 智能联动:选项会随模型类型自动调整——
- PCA 模型:不显示
y_scaler(没有 Y)- PLS / OPLS:显示
y_scaler,不显示y_binarizer- PLS-DA / OPLS-DA:两者都显示
默认勾选
model、x_scaler、model_info(有 Y 时自动加上y_scaler),这是最小可用组合。
第三步:查看使用说明
弹窗右侧内置了完整的 Python 使用说明与代码示例,无需另外查文档。
依赖安装:
pip install pandas scikit-learn joblib包结构:下载的 .joblib / .pkl 文件实际上是一个 Python dict,键取决于你的勾选。
典型工作流:
import joblib
# 1. 加载模型包
pkg = joblib.load("custom_model_package_xxx.joblib")
model = pkg["model"]
x_scaler = pkg["x_scaler"]
y_scaler = pkg.get("y_scaler")
y_bin = pkg.get("y_binarizer")
# 2. 数据预处理(必须与训练时一致)
X_new_scaled = x_scaler.transform(X_new)
# 3. 执行预测
y_pred = model.predict(X_new_scaled)
# 4. 结果还原
# 回归模型:用 y_scaler 还原量纲
y_real = y_scaler.inverse_transform(y_pred)
# 分类模型:用 y_binarizer 还原类别标签
labels = y_bin.inverse_transform(y_pred)⚠️ 最容易出错的一步是第 2 步:新数据必须用同一套
x_scaler做变换,否则预测结果完全不可信。
🧹 出口三:干净的数据与分析报告
干净的数据 (Clean Data)
经过你层层筛选、剔除异常值后的精华数据。
- 格式:CSV
- 用途:可直接用于其他分析软件,或作为下一次建模的"黄金标准"数据集
- 获取方式:在右侧模型列表的数据行区域,点击 Full / Tr / Te 三个小下载图标,分别导出完整数据集 / 训练集 / 测试集
- 文件命名:
{模型名}_{full_data|train_data|test_data}.csv
💡 平台内部以 Parquet 存储数据,下载时会自动转换为 CSV(UTF-8 with BOM,Excel 打开不乱码)。
📌 注意区分:实例列表里的「下载」列导出的是你最初上传的原始 Excel 文件,不是清洗后的数据。 要拿到清洗成果,请用上面模型列表里的下载按钮。
分析报告 (Analysis Report)
平台有两类报告可导出,格式各不相同:
| 报告类型 | 生成方式 | 支持导出格式 |
|---|---|---|
| AI 清洗 / 对比 / 图表分析报告 | AI 分析菜单 | Markdown + Word |
| 场景分析 / 组态图分析报告 | 场景菜单 | Markdown + Excel(多工作表) |
- Markdown —— 适合归档、贴进知识库 / Wiki
- Word —— 适合直接补进汇报材料,无需再排版
- Excel —— 导出报告中的表格数据,可直接下发给车间填写
📷 出口四:图表与画布截图
| 方式 | 位置 | 产出 |
|---|---|---|
| 单图保存 | 图表右上角照相机 📷 | 该图表的高清大图,可直接插进 PPT |
| 保存画布截图 | 画布工具栏 | 把当前画布上排布好的所有图表整体截图 |
💡 保存画布截图特别适合做汇报:先把图表拖动排布成想要的样子(可用 自动排列 一键整理),再整张截下来。
🗂️ 完整导出能力对照表
| 你想要 | 用什么出口 | 产出格式 |
|---|---|---|
| 在另一台平台电脑复现模型 | 下载在线模型包 | .dimod |
| 在 Python 里自己用模型 | 自定义下载 | .joblib / .pkl |
| 只要清洗后的数据 | 模型列表 → Full / Tr / Te 下载图标 | .csv |
| 最初上传的原始文件 | 实例列表 → 下载 | 原始格式(.xlsx / .xls) |
| 一份能给老板看的报告 | AI 分析报告 | .md / .docx |
| 一份能给车间填的表 | 场景分析报告 | .md / .xlsx |
| 一张能插进 PPT 的图 | 图表 📷 / 画布截图 | 图片 |
⚠️ 注意事项
- 授权限制:模型下载(
.dimod与自定义下载)都需要授权开通下载权限 .joblib与.pkl二选一即可:.joblib对含大数组的模型更高效,.pkl兼容性更广- 注意 scikit-learn 版本:用 Python 加载模型包时,
scikit-learn版本差异较大可能导致加载告警,建议与生成环境保持一致 x_scaler别漏勾:只下载model而漏掉x_scaler,会导致预测结果完全错误
🔗 相关阅读
- AI 智能能力总览 —— AI 报告体系与导出
- 模型预测(含复制粘贴) —— 不导出文件,直接在平台内预测
- 模型探索与参数寻优 —— 用模型反推最优工艺参数