材料配方质量预测(分类预测)
背景
在新材料行业(如胶水、涂料、墨水),产品研发正经历从“经验驱动”向“数据驱动”的艰难转型。传统的“老师傅经验”在“短平快”的市场节奏前显得力不从心——为了抢占先机,某胶水企业 70% 的产品配方设计周期被压缩至 2 周以内。与此同时,为降本增效,企业每年引入数千种新原料,配方组合呈指数级增长。
然而,研发部门长期依赖 Excel 等工具处理配方数据,面对高维、非线性的复杂变量关系时,不仅计算效率低下,更关键的是无法对海量实验数据进行有效的结构化分类。
通过 DTEmpower 对某墨水厂实测配方数据进行分类预测建模,以“耐弯折性能是否达标”为二分类预测目标,学习历史实验数据中配方组分与工艺参数等输入特征与达标/不达标标签之间的映射关系,构建分类决策规则。模型训练完成后,输入新配方的组分与工艺数据,即可快速输出耐弯折性能是否达标的预判结果。
案例目标
通过本案例,您将了解如何在 DTEmpower 中完成材料配方分类预测建模的完整流程,包括:
- 了解如何在项目中导入 csv 格式的训练数据,为后续模型训练准备数据基础;
- 学习如何使用智能数据处理功能对数据进行预处理,对特征数据进行筛选;
- 学习如何使用专家模式的分类预测功能,以“耐弯折性能是否达标”为目标列训练分类预测模型,并且选择最合适的算法模型;
- 了解如何查看模型评估结果,并通过准确率、ROC 曲线、混淆矩阵等信息判断模型效果;
- 了解如何将评估效果满足要求的模型进行部署;
- 学习如何使用已部署的模型对新配方或未知样本进行类别预测,判断其耐弯折性是否达标。
案例数据集
本案例包含训练集和用于模型预测的预测集:
操作步骤
建立项目
在主界面点击【新建项目】,输入项目名称,创建项目并进入项目页面。
材料配方质量分类预测:建立项目
上传数据
点击【导入数据】,此处文件为 csv 格式,点击【上传】。选择训练集数据文件。
材料配方质量分类预测:上传数据
材料配方质量分类预测:上传数据
数据集有 89 行,92 列,目标列为「耐弯折性」,0 表示性能不达标,1 表示性能达标,其中标签为 0 的有 33 行,标签为 1 的有 56 行。「物料代码」只是编号,不作为输入特征。性能 1 至性能 7 为不关注的其余性能指标。其余列均为不同原料的配方比例。
材料配方质量分类预测:上传数据
数据预处理
回到「流程」,选中导入数据,点击右侧【智能数据处理】,在对话框中输入自然语言指令,智能体将自动完成数据处理。
材料配方质量分类预测:数据预处理
该数据集中有多个特征,可根据经验清除一些不重要的特征。性能 1 至性能 7 为不关注的其余性能指标,与目标列「耐弯折性」无直接关系。在智能体中输入"删除性能1至性能7的列",删除不重要的列,可以简化输入特征,提高模型训练效率。
材料配方质量分类预测:数据预处理
可以在「脚本」处查看智能体处理数据的脚本。点击【运行】,处理数据。
材料配方质量分类预测:数据预处理
可在「输入数据集」和「输出数据集」处看到处理后的数据的行和列。
材料配方质量分类预测:数据预处理
材料配方质量分类预测:数据预处理
运行完成后,输出的数据集展示在「流程」的画布中。
材料配方质量分类预测:数据预处理
模型训练
选中处理后的数据,点击右侧【分类预测】,在模型训练模块进行模型训练。
材料配方质量分类预测:模型训练
此处分类的目标为其耐弯折性,因此在目标列名中选择「耐弯折性」。可以根据需求选择不同的模式,「自动机器学习」模式下,平台可根据所选模式自动完成算法筛选与参数配置,更加适合初学者。而「专家模式」则更适合已有经验的用户,可自行选择算法和参数。「自动机器学习」模式下有「快速模式」、「可解释模式」和「高性能模式」,各模式特点在界面上已有说明。本案例展示专家模式的效果,模型名称可自定义或使用系统默认名称。
材料配方质量分类预测:模型训练
可在「训练配置」处看到目标类别的分布情况,此处 0 表示耐弯折性不达标,1 则表示耐弯折性达标。
材料配方质量分类预测:模型训练
「阈值优化指标」选择准确率。准确率为模型分类正确的样本数占总样本数的比例,同时考量了“正确识别正例”和“正确识别负例”。
材料配方质量分类预测:模型训练
「算法选择」可选择不同算法,后续根据结果选择表现更优的算法模型。此处选择决策树、逻辑回归、随机森林和极端随机森林,用户也可选择其他算法进行对比。
材料配方质量分类预测:模型训练
开启「超参优化」,「超参优化深度」和「最大训练时长」使用默认值。该功能可在限定搜索空间和训练时长内搜索候选参数组合。
材料配方质量分类预测:模型训练
点击【训练】,输入任务名称,点击【训练】。等待训练结束即可。
材料配方质量分类预测:模型训练
训练结束后,可以在左侧看到不同算法的准确率,通过比较可选择表现更优的算法模型。
材料配方质量分类预测:模型训练
可在「精度统计」处查看不同算法更为详细的评估指标。
材料配方质量分类预测:模型训练
选择 Extra Trees 模型,点击【查看详情】,可以看到「特征重要性排序」,即每个特征对模型的贡献程度。
材料配方质量分类预测:模型训练
可以查看 ROC 曲线,ROC 曲线是评估分类模型性能的一种常用工具,横轴为假正例率(FPR),即被错误地分类为正例的样本占所有负例样本的比例,纵轴为真正例率(TPR),即被正确识别为正例的样本占所有实际正例样本的比例。曲线越接近左上角,表示模型性能越好。AUC 表示 ROC 曲线下面积,AUC 值越大,模型性能越优。
材料配方质量分类预测:模型训练
混淆矩阵是评估分类模型的工具,它展示了模型预测结果与实际结果的对比。矩阵的行代表实际类别,列代表预测类别。四个格子分别表示:真正例(实际和预测都是正类)、假正例(实际是负类但预测为正类)、假负例(实际是正类但预测为负类)和真负例(实际和预测都是负类)。通过这个矩阵,可以直观地看到模型在哪些类别上表现好,哪些类别上容易出错。
材料配方质量分类预测:模型训练
模型部署
对于满意的模型,点击【部署】,可以将模型部署至生产环境中,用于后续预测。
材料配方质量分类预测:模型部署
模型预测
上传预测集的数据。
材料配方质量分类预测:模型预测
材料配方质量分类预测:模型预测
点击部署的模型,点击右侧的【预测】,选择预测集数据。
材料配方质量分类预测:模型预测
材料配方质量分类预测:模型预测
点击【运行】,运行成功后右下角将出现弹窗提示,预测结果可在数据中查看。
材料配方质量分类预测:模型预测
材料配方质量分类预测:模型预测
案例总结
材料配方研发涉及多种组分与工艺参数,传统经验和反复实验难以高效分析复杂变量关系。利用历史实验数据建立分类预测模型,可为配方性能预判和候选方案筛选提供数据支持,具有缩短研发周期、减少试错的应用价值。
本案例使用 DTEmpower 对中性 UV 墨水配方数据进行处理和建模,以耐弯折性能是否达标为目标,实现对新配方的辅助预测,展示了材料配方数据从分析到模型应用的过程。该方法可为胶水、涂料、墨水等材料配方研发提供参考。
