新能源汽车用户口碑多源融合与续航分析(多源数据融合与回归训练)
背景
新能源汽车的用户体验受车辆配置、使用环境和驾驶习惯等多种因素影响。用户车评中包含续航、充电、空间、驾驶感受和购车情况等关键信息,但这些信息以自然语言形式分散在文本中,难以直接用于横向比较、趋势观察和建模分析。
本解决方案以 500 条 用户车评为基础,引入车型配置维表和城市环境维表,将文本中的事实字段、主题和情感信息结构化,并与标称续航、电池容量、配置等级、气温、地形起伏度和人均 GDP 等信息进行关联。通过标准化城市、车型和配置键,确保不同来源数据能够稳定融合并保留可追溯的质量检查结果。
在得到统一分析宽表后,方案进一步构造续航达成率、温度分箱、购车负担比和 GDP 四分位等指标,用于观察续航表现、使用环境与用户反馈之间的分布特征。同时,分别以续航达成率和实测续航为目标变量训练回归模型,为产品运营、用户研究和续航表现分析提供可复用的数据处理与建模路径。
案例数据集
本案例包含原始车评文本、车型配置维表、城市环境维表和智能数据处理提示词:
方案流程
本解决方案包含以下流程:
- 导入车评文本、车型配置和城市环境三类数据;
- 对车评文本进行质量检查,并抽取事实字段、主题和情感信息;
- 标准化城市、车型和配置名称,关联车型配置与城市环境维表;
- 构造续航达成率、温度分箱和 GDP 分位等分析指标;
- 检查关联覆盖率和主表质量,并创建描述性图表;
- 以续航达成率和实测续航为目标变量,训练并部署回归模型。
实施步骤
导入数据并检查文本质量
新建项目后,依次导入原始车评文本、车型配置维表和城市环境维表。对单列「网友车评」执行智能数据处理,检查空文本、重复文本、异常编码和过短文本。
发起文本质量检查
处理完成后,打开输出数据集,确认质量检查结果。
查看文本质量检查结果
抽取车评事实字段
从车评文本中抽取城市、车型、车型配置、购买月份、行驶里程、电耗、续航和购买价格等字段,保留原始车评列,作为后续关联与统计的基础。
配置事实字段抽取
运行后,确认输出行数与输入一致,并检查新增字段。
验证事实字段抽取结果
识别主题、情感和评论字数
继续处理事实字段结果,生成「NER_主主题」、情感分数、情感标签和评论字数,用于分析用户关注点和评论表达特征。
配置主题与情感处理
处理完成后,检查新增字段的覆盖情况和情感标签分布。
查看主题与情感处理结果
标准化城市、车型和车型配置
清理多余空格、后缀和无效字符,统一城市别名,并检查车型和车型配置能否匹配配置维表,避免后续关联出现漏配或错配。
配置城市与车型标准化
完成后,查看标准化结果和未匹配清单。
验证标准化结果
关联车型配置属性
以「车型 + 车型配置」为关联键,连接车型配置维表,补充标称续航、电池容量、配置等级、驱动形式和配置基准价等属性。
关联车型配置维表
关联后,确认主表行数未减少,且车型配置属性已经补充。
查看车型配置关联结果
融合城市环境信息
先检查城市环境维表的城市键唯一且关键字段无缺失,再按「城市」左连接至车评数据,补充年平均气温、地形起伏度和人均 GDP 等环境字段。
检查城市环境维表
关联城市环境信息
完成后,核对输出行数、关联覆盖率和城市匹配状态。
验证城市环境关联结果
构造分析指标
基于融合后的宽表,生成续航达成率、温度偏离、低温缺口、高温超额和购车负担比等基础指标;再生成温度分箱、GDP 四分位、地形分组和有序情感等级等分组分析字段。
构造基础分析指标
构造分组分析指标
检查关联与主表质量
检查城市、气温、地形、人均 GDP 和车型配置的关联缺失情况;再检查口碑 ID 重复、关键字段空值、城市样本量、文本长度和情感分布。
检查关联覆盖率
检查主表质量
创建分析图表
使用分析宽表创建图表,观察样例数据的分布、主题构成和分组差异。
续航达成率分布直方图
NER 主题构成饼图
温度、地形与续航三维散点图
温度区间与续航达成率折线图
GDP 分组与购车价柱状图
主题与情感分布小提琴图
情感等级与评论字数箱线图
训练并部署续航达成率回归模型
基于分析宽表创建回归预测任务,将「续航达成率」设为目标变量。在特征处理中,对数值特征使用自动缩放,并保留缺失值处理设置。
配置续航达成率模型特征处理
完成训练后,查看模型指标和特征重要性;本方案选择 Ridge 模型进行部署。
查看续航达成率模型训练结果
部署续航达成率模型
训练并部署实测续航回归模型
在流程中从分析宽表发起回归预测任务,将「实测续航_公里」设为目标变量,并选择自动机器学习的快速模式。
从分析宽表发起实测续航回归任务
新建实测续航回归任务
训练完成后,比较算法结果并选择表现合适的模型。当前训练结果中 Ridge 模型的 R² 为 0.892。
查看实测续航模型训练结果
部署实测续航模型
部署完成后,可在流程画布中查看生成的实测续航回归模型节点。
查看实测续航模型流程结果
方案总结
本解决方案将用户车评、车型配置和城市环境数据整理为统一分析宽表,建立了从非结构化文本到结构化指标、从多源数据关联到质量验证、从描述性图表到回归建模的完整分析链路。通过对关联覆盖率、主表重复值和关键字段缺失的检查,保障后续分析和建模建立在一致、可用的数据基础上。
融合后的数据可用于识别不同温度区间、地形条件、车型配置和用户关注主题下的续航表现差异,也可用于观察评论情感与使用体验之间的分布特征。方案中提供的直方图、饼图、三维散点图、折线图、柱状图、小提琴图和箱线图,为业务人员从多个角度理解用户反馈和车辆使用环境提供直观依据。
在此基础上,方案分别训练并部署续航达成率与实测续航的回归模型。模型能够为后续续航分析、用户体验研究和产品运营中的数据驱动决策提供参考;在实际业务中,可结合新增用户数据、车型数据和环境数据持续更新分析宽表与模型,实现更贴近业务场景的分析和预测。
