机器学习

DTEmpower 提供可视化机器学习建模能力,支持结构化数据、时序数据与图像数据的智能建模任务,覆盖分类预测、回归预测、时序预测、图像分类和目标检测等常见 AI 场景。用户无需编写复杂代码,即可通过可视化界面完成数据准备、模型训练、模型评估、模型保存与预测推理等完整建模流程。

平台采用统一的机器学习任务流程设计,不同任务类型均遵循 “数据准备 → 模型配置 → 模型训练 → 模型评估 → 模型部署 → 模型预测” 的标准流程,帮助用户快速完成模型构建与业务落地。

任务类型

  • 分类预测:使用结构化数据预测离散类别,例如合格与不合格、风险等级或产品类型。
  • 回归预测:使用结构化数据预测连续数值,例如质量指标、能耗或设备参数。
  • 时序预测:根据按时间顺序记录的历史数据预测未来一个或多个时间步的连续数值,例如销量、能耗、设备参数或压力变化趋势。
  • 图像分类:为整张图像预测所属类别,适合缺陷类型、产品类型或状态识别。
  • 目标检测:识别图像中的目标类别和位置,适合缺陷定位、目标计数或区域检测。

开始训练前,应确认训练数据、目标字段或已有标签信息与任务类型匹配。训练完成后,结合任务适用的评价指标、图表和业务使用条件选择模型。

训练完成后,系统会在【训练结果】中展示候选模型和评价结果。可切换评价指标并点击【查看详情】查看模型报告;不同数据集、数据划分或目标变量的结果不宜直接横向比较。确认模型效果符合预期后,再保存或部署模型用于预测。

图像分类

图像分类任务用于识别图像所属的类别,即通过模型自动判断输入图像属于哪一种分类。在工业视觉、缺陷检测、产品识别、状态识别等场景中,可用于零件缺陷分类、产品类别识别、设备状态识别等任务。

用户在流程界面中选择图像数据后,可通过右侧「机器学习」分类中的【图像分类】算子快速创建图像分类训练任务。

创建图像分类任务创建图像分类任务

图像分类任务配置从数据源、训练集/测试集、配置参数、评价指标和数据增强多个方式灵活调整配置。

平台支持配置训练轮数、批量大小、优化器、学习率调度器、预训练模型等训练参数,并支持 Accuracy、Precision、Recall、F1 Score、ROC-AUC 等多维度分类评价指标。

配置图像分类训练参数配置图像分类训练参数

训练启动后,系统自动进入训练结果页面,实时展示训练进度、Loss 曲线与模型评估结果,支持查看预测结果数据。

查看图像分类训练结果查看图像分类训练结果

在模型详情页面,可查看模型基本信息、训练参数和评估指标,了解模型配置及分类效果。

查看图像分类模型详情查看图像分类模型详情

完整的图像分类训练、评估和预测操作,可在图像分类任务教程中查看。

目标检测

目标检测任务不仅能够识别图像中的目标类别,还能够精准定位目标所在区域,通过边界框输出目标位置与类别信息。在工业检测、安全监控、视觉识别等场景中,可用于缺陷定位、目标识别、物体检测等任务。

用户在流程界面中选择目标检测数据集后,可通过右侧「机器学习」分类中的【目标检测】算子快速创建目标检测训练任务。

创建目标检测任务创建目标检测任务

目标检测任务配置从数据源、训练集/测试集、配置参数、评价指标和数据增强多个方式灵活调整配置。

平台支持配置训练轮数、批量大小、优化器、学习率调度器、预训练模型等训练参数,并支持 mAP、Precision、Recall、F1 Score、IoU 等多维度目标检测评价指标。

配置目标检测数据源配置目标检测数据源

训练启动后,系统自动进入训练结果页面,实时展示训练进度、Loss 曲线与模型评估结果,支持查看目标检测结果与评估数据。

查看目标检测训练结果查看目标检测训练结果

在模型详情页面,可查看模型基本信息、训练参数和评估指标,了解模型配置及检测效果。

完整的目标检测训练、评估和预测操作,可在目标检测任务教程中查看。

分类预测

分类预测任务主要用于对结构化表格数据进行智能建模与分类分析 。在化工配方优化、工业质量控制、物性测试等场景中,可用于判断产品耐折性、合格判定或多分类级别预测等任务 。

分类预测任务概览分类预测任务概览

创建分类预测任务时,可以选择自动机器学习或专家模式:

  • 自动机器学习:适合希望由系统自动完成候选模型训练和结果比较的场景。可根据建模需求选择快速、可解释或高性能模式。
  • 专家模式:适合需要自行选择算法、调整训练参数或控制建模过程的场景。

在流程画布界面中,选中数据集节点,在右侧「机器学习」分类下点击【分类预测】算子,即可创建分类预测任务 。

创建分类预测任务创建分类预测任务

核心配置主要包含以下几部分:

目标变量:指定分类目标列。同步展示样本特征分布与各类别占比,用于快速校验数据完整性与类别分布合理性 。

训练/测试集配置:测试集拆分支持自定义分割方法、训练集占比与随机种子(如 42),通过固定拆分结果以保证实验可复现。

评价指标:可按需配置评估指标和阈值优化目标。

特征处理:特征处理面板会自动解析并呈现全量特征字段。用户在此勾选需要参与建模的特征属性,并支持直接查看特征分布信息 。

算法选择与超参优化:算法面板支持多算法并行建模 。用户可勾选 逻辑回归 (Logistic Regression) 或 决策树 (Decision Tree) 等经典算法 ,并能针对选中算法的超参数进行精细微调优化 。

配置分类预测目标变量配置分类预测目标变量

配置分类预测特征处理配置分类预测特征处理

选择分类预测算法并配置参数选择分类预测算法并配置参数

配置完成后点击【训练】按钮即可启动建模任务 。训练启动后,系统自动进入训练结果页面,完成后展示各算法的评估结果。

查看分类预测训练结果查看分类预测训练结果

点击对应模型的【查看详情】即可进入到具体的模型详情页面,包括总结、特征重要性排序、ROC曲线、混淆矩阵和具体的算法参数信息。

查看分类预测模型详情查看分类预测模型详情

完整的分类预测训练、评估和预测操作,可在分类预测任务教程中查看。

回归预测

回归预测任务用于根据历史结构化数据中的多个特征变量,预测连续型数值结果。它适用于产线参数预测、设备状态趋势分析、质量指标预测、能耗预测和智能预警等场景。

用户在流程界面中选择结构化训练数据集后,可通过右侧「机器学习」分类中的【回归预测】算子创建任务。创建时选择需要预测的数值型目标列,并按业务需求选择自动机器学习模式:快速模式适合快速验证,可解释模式适合关注模型决策逻辑的场景,高性能模式适合对模型效果要求更高且可接受较长训练时间的场景。

创建回归预测任务创建回归预测任务

进入训练配置页面后,可配置目标变量、训练集与测试集划分、评价指标和训练模式;也可在特征工程中处理或精简特征,并在建模配置中选择参与训练的算法和超参优化方式。平台支持决策树、弹性网络、支持向量机、XGBoost、随机森林、极端随机树、直方图梯度提升和多层感知机等回归算法。

配置回归预测训练参数配置回归预测训练参数

回归预测任务的专家模式还支持配置模型约束。用户可在【模型约束】中设置输入变量和/或输出变量之间的约束表达式。

配置回归预测模型约束配置回归预测模型约束

训练完成后,系统会展示最佳模型、核心评价指标、算法参数、特征重要性、训练与测试集数据量及训练耗时。可结合 R²、MAE、MAPE、MSE 和 RMSE 等指标,评估模型的拟合效果和预测误差。

查看回归预测训练结果查看回归预测训练结果

点击训练结果中的【查看详情】可进入模型报告,查看特征重要性、实际值与预测值的散点图、误差诊断、评价指标和算法信息,用于进一步分析模型效果。

查看回归预测模型报告查看回归预测模型报告

完整的数据导入、训练、评估和预测操作,可在回归预测任务教程中查看。

时序预测

时序预测任务用于学习目标变量随时间变化的规律,并结合可用的外源变量预测未来一个或多个时间步的数值。该任务适用于生产指标、设备状态、能源消耗、销售需求和环境监测等具有明确时间顺序的连续数据。与普通回归预测相比,时序预测会保留记录之间的时间关系,并支持单时间序列、多时间序列、历史时移特征和滚动窗口聚合特征。

在「流程」中选择包含时间字段和数值型目标字段的数据集,然后在右侧「机器学习」中单击【时序预测】,即可创建时序预测任务。

创建时序预测任务创建时序预测任务

进入「训练配置」后,先在「基础设置」中指定目标变量和时间变量,并选择单时间序列或多时间序列。多时间序列适用于同一数据集中包含多个设备、产品、区域或其他独立序列的场景,需要进一步指定时间序列标识。随后设置时间步长、预测窗口(时间步数)、评估跳过时间步数和预测分位数。

预测窗口表示模型一次需要预测的未来时间步数量;评估跳过时间步数用于在回测时跳过预测起点后的部分时间步;预测分位数用于输出不同概率水平的预测结果,其中 0.5 表示中位数预测。

配置时序预测基础设置配置时序预测基础设置

在「训练/测试集」中配置时间序列重采样和评估数据划分。数值插值用于补齐序列内部缺失时间点的数值,数值外推用于处理序列首尾范围内缺失时间点的数值;当同一时间戳对应多条记录且其他字段值不一致时,可通过重复时间戳处理方式决定是否报错、删除冲突记录或使用数值列均值。测试集窗口数决定用于回测评估的连续窗口数量,也可以启用 K 折交叉测试以获得更全面的模型评估结果。

配置时序预测训练集和测试集配置时序预测训练集和测试集

在「外源变量」中,可以将目标变量之外的数值字段设置为“仅历史值”或“已知历史值和未来值”。仅历史值适用于预测时无法提前获得未来数据的变量;已知历史值和未来值适用于计划价格、排产计划、节假日等可以预先获得未来取值的变量。选中外源变量后,还可以设置数值特征缩放方式和缺失值填充方式,并查看该字段的分布信息。

配置时序预测外源变量配置时序预测外源变量

在「特征生成」中,可以为目标变量和已启用的外源变量构造时移特征。相对于预测起点的偏移量在整个预测窗口内保持不变;相对于预测点的偏移量会随预测位置逐步移动,可选择自动处理或固定偏移量。还可以添加滚动窗口,按设定的时间范围计算平均值、标准差、最小值、最大值或中位数等聚合特征。特征生成主要供经典机器学习算法使用。

配置时序预测特征生成配置时序预测特征生成

在「算法选择」中,可根据数据规律和计算资源启用一个或多个算法。平台提供以下三类时序预测算法:

  • 统计模型:Auto ARIMA、Prophet;
  • 深度学习模型:DeepAR、NHITS、TFT;
  • 机器学习模型:Random Forest、Ridge Regression、XGBoost。

启用算法后,可以在右侧查看和调整对应参数。统计模型适合分析趋势和季节性规律,深度学习模型适合学习较复杂的长短期时序关系,机器学习模型可以结合时移特征、聚合特征和外源变量建立预测关系。实际使用时,可同时训练多个算法并根据统一评价指标比较结果。

选择时序预测算法选择时序预测算法

完成配置后单击【训练】。训练结束后,在「训练结果」中选择评价指标,可以比较不同算法的指标值和回测趋势。每个模型卡片会展示算法参数、训练状态、训练数据量、训练时长和局部预测曲线;单击【查看详情】可进入对应模型报告。

查看时序预测训练结果查看时序预测训练结果

模型报告中的「时序预测图」用于对比实际值、回测预测值和未来预测值。通过图表下方的时间缩略轴可以调整查看范围,检查模型是否能够跟随目标变量的变化趋势。报告还提供特征重要性、整体指标、各时间序列指标、各预测步长指标、重采样配置、特征配置和算法参数等信息。

查看时序预测报告查看时序预测报告

在「误差诊断」中,可以结合残差分布图、残差时序图、正态 Q-Q 图和自相关图检查预测误差的分布、时间变化和相关性。页面同时给出 Jarque-Bera 正态性检验、偏度和峰度等统计量,为判断模型是否仍遗漏趋势、周期或异常波动提供参考。

查看时序预测误差诊断查看时序预测误差诊断

确认模型效果符合使用要求后,可按照下方“部署、评估和预测”的通用流程完成模型部署。时序预测任务的完整配置、训练和部署操作,可在时序预测任务教程中查看;结合工业数据处理和独立测试集评估的完整过程,可在乙烯裂解炉结焦程度预测(时序预测)中查看。

部署、评估和预测

部署模型

机器学习任务训练完成后,都可以在训练结果中打开候选模型的详情页。确认评价指标和模型报告符合使用要求后,点击【部署】并填写模型名称,完成模型部署。

模型部署成功模型部署成功

评估模型

模型部署完成后,可以使用评估数据集检验模型在指定数据上的预测效果。进入项目的「流程」模块,选中已部署的模型节点,在右侧「模型预测」区域点击【评估】。

选择模型评估选择模型评估

在「新建评估」窗口中,选择评估数据集和待评估模型,并设置用于保存评估结果的 评估数据集 和 评估指标 两个输出数据集。完成后点击【确认】,进入「模型评估」页面。

新建模型评估任务新建模型评估任务

在「配置」页设置输出选项。开启【合并输入数据】后,评估结果中将保留原始输入字段;需要使用 GPU 执行评估任务时,可开启【GPU 配置】。不同类型的模型会输出相应的评价指标,具体指标可在当前页面的「评价指标」区域查看。确认配置后点击【运行】。

配置模型评估任务配置模型评估任务

运行完成后,流程画布中会生成评估结果数据集和评估指标数据集,可分别查看模型预测结果与各项评价指标。

使用模型预测

部署完成后,模型会显示在流程画布中。选中模型节点,在右侧选择【预测】算子;在预测配置中关联待预测数据和输出数据集,确认后运行任务即可生成预测结果。

执行预测前,应确认待预测数据与训练数据使用相同的特征字段或图像数据格式。预测完成后,可打开输出数据集查看结果,并根据业务需要继续处理或使用预测数据。