回归预测任务

回归预测任务用于根据历史结构化数据中的多个特征变量,学习连续型目标变量与输入特征之间的关系,并对新样本输出数值型预测结果。该类任务适用于产线参数预测、设备状态趋势分析、质量指标预测、能耗预测、智能预警等业务场景。

DTEmpower 提供 AutoML 回归建模能力。用户只需完成数据导入、目标变量选择与基础训练配置,系统即可自动完成特征处理、算法筛选、模型训练、评估对比与模型部署,降低回归建模的使用门槛。

导入数据集

进入已创建的项目「回归训练 AutoML」后,在流程界面点击右上角【导入数据】,选择【上传】,即可从本地导入用于训练的结构化数据集。回归预测任务支持上传 CSV、Excel 等表格文件。

选择导入数据集选择导入数据集

在文件上传窗口中,选择准备好的训练数据集文件。本示例使用的数据集为“回归分析-智能模型预警-训练数据集.csv”,数据中包含时间字段、多个工艺特征字段以及待预测的目标变量字段。

选择回归训练数据集选择回归训练数据集

数据导入完成后,可进入「数据」模块查看数据集内容。系统会以表格形式展示数据字段、字段类型与各行数据内容,便于用户确认数据是否成功导入,以及目标变量和特征变量是否符合训练要求。

查看回归训练数据集查看回归训练数据集

回归模型训练

回到「流程」界面,选中已导入的训练数据集节点,右侧面板将展示该数据集可执行的算子。在「机器学习」分类中点击【回归预测】算子,即可创建回归预测训练任务。

在弹出的「新建回归预测任务」窗口中,首先选择目标列名,即需要模型预测的连续型数值字段。本示例选择“反渗透二段压差”作为目标变量。随后选择自动机器学习模式,平台提供快速模式、可解释模式、高性能模式三种模式:

  • 快速模式适合快速验证建模效果。
  • 可解释模式更关注模型结果的业务解释。
  • 高性能模式适合对模型效果要求较高且可接受更长训练时间的场景。

配置完成后点击【确认】。

创建回归预测任务创建回归预测任务

任务创建完成后,系统自动跳转至「实验」模块的回归预测任务页面。首次进入时,训练结果区域显示暂无训练结果。用户可点击【查看训练配置】进入参数配置页面,也可以通过顶部【训练配置】页签进行配置。

进入回归训练配置进入回归训练配置

训练配置页面包含基础设置、特征工程与建模配置。基础设置中可配置目标变量、训练集与测试集划分方式、评价指标与训练模式;特征工程中可进行特征处理与特征精简;建模配置中可选择参与训练的算法与超参优化方式。

在算法选择页面,系统支持决策树(Decision Tree)、弹性网络(Elastic Net)、支持向量机(Support Vector Machine)、极端梯度提升(XGBoost)、随机森林(Random Forest)、极端随机树(Extra Trees)、直方图梯度提升、多层感知机等多种回归算法。AutoML 模式下,平台可根据所选模式自动完成算法筛选与参数配置,用户也可以按业务需要手动启用或关闭指定算法。

配置回归训练算法配置回归训练算法

确认训练配置无误后,点击右上角【训练】按钮。系统将弹出训练确认窗口,可选择是否启用 GPU 进行回归预测模型训练,并填写任务名称。窗口中会同步展示训练集与测试集的数据量,确认后再次点击【训练】,即可启动模型训练任务。

启动回归模型训练启动回归模型训练

训练完成后,系统将在「训练结果」页面展示本次训练任务的最佳模型、核心评价指标、算法参数、特征重要性排序、训练集与测试集数量以及训练耗时。本示例中,系统自动选择 XGBoost 作为最佳模型,R²(决定系数)为 0.987,说明模型对测试数据具有较好的拟合效果。

在指标页面中,可查看 R²、MAE、MAPE、MSE、RMSE 等回归评价指标,用于从不同角度衡量模型误差与拟合效果。用户可结合业务需求判断模型是否满足上线或预测要求。

查看回归训练结果查看回归训练结果

点击训练结果中的【查看详情】,可进入模型详情页面。模型报告中提供总览、可解释性、性能分析与模型信息等内容,支持查看特征重要性排序、散点图、误差诊断、评价指标和算法信息。散点图用于展示实际值与预测值的对应关系,点越接近参考线,表示模型预测结果越接近真实值。

查看回归模型报告查看回归模型报告

查看回归模型性能分析查看回归模型性能分析

确认模型效果符合预期后,点击右上角【部署】按钮。在部署模型窗口中选择训练数据集并填写模型名称,点击【确认】完成部署。模型部署完成后,将自动加入流程画布,供后续预测任务调用。

部署回归预测模型部署回归预测模型

回归模型预测

模型部署完成后,回到「流程」界面,可以看到训练数据集、回归预测训练任务以及已部署模型节点形成完整流程链路。选中已部署的模型节点,右侧面板会展示模型基础操作与【预测】算子。

查看已部署回归模型查看已部署回归模型

执行预测前,需要先导入待预测数据集。点击右上角【导入数据】,选择【上传】,从本地导入预测数据文件。预测数据应包含与训练数据一致的特征字段,目标变量字段可为空或不存在。

导入回归预测数据集导入回归预测数据集

预测数据导入完成后,在流程中选中已部署模型节点,点击右侧【预测】算子,弹出「新建预测」窗口。在输入配置中选择预测数据集与已部署模型;在输出配置中填写预测结果数据集名称,选择输出数据源与文件格式。配置完成后点击【确认】。

配置回归预测任务配置回归预测任务

进入预测配置页面后,可进一步确认输入数据、模型与输出结果设置。点击【运行】后,系统将调用已部署的回归预测模型,对预测数据集中的每条样本生成对应的预测值。

运行回归预测任务运行回归预测任务

预测任务运行完成后,流程画布中会自动生成预测结果数据集节点。进入「数据」模块打开预测结果数据集,可查看原始特征字段以及系统新增的 prediction 字段。该字段即模型输出的回归预测结果,可用于后续业务分析、结果下载或继续参与流程编排。

查看回归预测结果查看回归预测结果