分类预测任务

分类预测用于根据历史结构化数据中的特征字段,判断样本所属的离散类别。本示例以设备运行特征为输入,预测设备故障类型(Fault_Type);训练数据包含振动、声学、温度等特征字段及目标分类字段。

导入训练数据

在流程界面点击【导入数据】,选择【上传】。

选择上传数据集选择上传数据集

在文件选择窗口中选择训练数据文件(如 train.csv),然后点击【创建】完成导入。分类预测支持 CSV、Excel 等结构化数据文件。

选择分类预测训练数据选择分类预测训练数据

创建分类预测训练任务

在流程画布中选中训练数据集 train,在右侧【机器学习】中点击【分类预测】。

选择分类预测算子选择分类预测算子

在新建任务窗口中,将目标列设置为需要预测的分类字段(如 Fault_Type),选择训练模式并填写任务名称。

  • 自动机器学习:适合希望由系统自动完成候选模型训练和结果比较的场景。可根据建模需求选择快速、可解释或高性能模式。
  • 专家模式:适合需要自行选择算法、调整训练参数或控制建模过程的场景。

选择自动机器学习时,可继续选择以下模式:

  • 快速模式:适合快速验证建模效果。
  • 可解释模式:适合需要理解模型决策逻辑的场景。
  • 高性能模式:适合追求更高模型效果且可接受较长训练时间的场景。

创建分类预测任务创建分类预测任务

确认后,系统进入【实验】模块的训练配置页面。

配置并训练模型

训练配置包含目标变量、训练集/测试集、评价指标、训练模式、特征处理、特征精简、算法选择和超参优化等内容。

在【训练集/测试集】中,选择数据拆分方式并设置训练集占比。设置固定的随机种子后,在相同数据和配置下可得到相同的拆分结果,便于后续比较不同模型的训练效果。

在特征处理页面,选择需要参与训练的特征字段;目标列不会作为特征参与训练。

配置分类预测特征配置分类预测特征

在算法选择页面,可按需启用逻辑回归、决策树、支持向量机、XGBoost、随机森林、极端随机树、直方图梯度提升和多层感知机等算法。自动机器学习模式下,系统会根据所选模式自动配置算法参数。

配置分类预测算法配置分类预测算法

配置完成后点击右上角【训练】,填写任务名称并确认训练集、测试集数据量,再次点击【训练】启动任务。

启动分类预测训练启动分类预测训练

查看训练结果并部署

训练完成后,系统会展示候选模型的评价得分、算法参数、特征重要性、训练集和测试集数据量以及训练耗时。可在指标下拉框中选择 Accuracy、Precision、Recall、F1 Score 等评价指标,对比模型效果。

查看分类预测训练结果查看分类预测训练结果

点击【查看详情】可进入模型报告。报告中的混淆矩阵用于查看各类别的预测正确情况和易混淆类别。

查看分类预测混淆矩阵查看分类预测混淆矩阵

在【特征重要性排序】中可查看各输入特征对分类结果的影响程度,辅助进行特征筛选和业务分析。

查看分类预测特征重要性查看分类预测特征重要性

可在【ROC 曲线】中查看模型在不同阈值下的区分能力。确认模型效果符合预期后,点击右上角【部署】完成模型部署。

查看分类预测 ROC 曲线并部署查看分类预测 ROC 曲线并部署

执行分类预测

导入待预测数据集(如 predict)。预测数据应包含与训练数据一致的特征字段,但不需要包含目标分类字段。导入后,流程画布会显示训练数据、已部署模型和预测数据集。

准备分类预测数据集准备分类预测数据集

选中已部署的分类预测模型,在右侧【模型预测】中点击【预测】。

选择分类预测选择分类预测

在新建预测窗口中选择待预测数据集和已部署模型,设置输出数据集名称、数据源和格式,然后点击【确认】。

配置分类预测任务配置分类预测任务

进入预测配置页面后,确认输入数据集、模型和输出数据集,点击【运行】执行预测。

运行分类预测运行分类预测

预测完成后,流程画布会生成预测结果数据集节点。

生成分类预测结果数据集生成分类预测结果数据集

打开预测结果数据集,可查看每个类别的预测概率以及 prediction 字段;prediction 即该样本最终预测出的分类结果。

查看分类预测结果查看分类预测结果