新能源汽车用户口碑多源融合与续航分析(多源数据融合与回归训练)

背景

新能源汽车的用户体验受车辆配置、使用环境和驾驶习惯等多种因素影响。用户车评中包含续航、充电、空间、驾驶感受和购车情况等关键信息,但这些信息以自然语言形式分散在文本中,难以直接用于横向比较、趋势观察和建模分析。

本解决方案以 500 条 用户车评为基础,引入车型配置维表和城市环境维表,将文本中的事实字段、主题和情感信息结构化,并与标称续航、电池容量、配置等级、气温、地形起伏度和人均 GDP 等信息进行关联。通过标准化城市、车型和配置键,确保不同来源数据能够稳定融合并保留可追溯的质量检查结果。

在得到统一分析宽表后,方案进一步构造续航达成率、温度分箱、购车负担比和 GDP 四分位等指标,用于观察续航表现、使用环境与用户反馈之间的分布特征。同时,分别以续航达成率和实测续航为目标变量训练回归模型,为产品运营、用户研究和续航表现分析提供可复用的数据处理与建模路径。

案例数据集

本案例包含原始车评文本、车型配置维表、城市环境维表和智能数据处理提示词:

方案流程

本解决方案包含以下流程:

  1. 导入车评文本、车型配置和城市环境三类数据;
  2. 对车评文本进行质量检查,并抽取事实字段、主题和情感信息;
  3. 标准化城市、车型和配置名称,关联车型配置与城市环境维表;
  4. 构造续航达成率、温度分箱和 GDP 分位等分析指标;
  5. 检查关联覆盖率和主表质量,并创建描述性图表;
  6. 以续航达成率和实测续航为目标变量,训练并部署回归模型。

实施步骤

导入数据并检查文本质量

新建项目后,依次导入原始车评文本、车型配置维表和城市环境维表。对单列「网友车评」执行智能数据处理,检查空文本、重复文本、异常编码和过短文本。

发起文本质量检查发起文本质量检查

处理完成后,打开输出数据集,确认质量检查结果。

查看文本质量检查结果查看文本质量检查结果

抽取车评事实字段

从车评文本中抽取城市、车型、车型配置、购买月份、行驶里程、电耗、续航和购买价格等字段,保留原始车评列,作为后续关联与统计的基础。

配置事实字段抽取配置事实字段抽取

运行后,确认输出行数与输入一致,并检查新增字段。

验证事实字段抽取结果验证事实字段抽取结果

识别主题、情感和评论字数

继续处理事实字段结果,生成「NER_主主题」、情感分数、情感标签和评论字数,用于分析用户关注点和评论表达特征。

配置主题与情感处理配置主题与情感处理

处理完成后,检查新增字段的覆盖情况和情感标签分布。

查看主题与情感处理结果查看主题与情感处理结果

标准化城市、车型和车型配置

清理多余空格、后缀和无效字符,统一城市别名,并检查车型和车型配置能否匹配配置维表,避免后续关联出现漏配或错配。

配置城市与车型标准化配置城市与车型标准化

完成后,查看标准化结果和未匹配清单。

验证标准化结果验证标准化结果

关联车型配置属性

以「车型 + 车型配置」为关联键,连接车型配置维表,补充标称续航、电池容量、配置等级、驱动形式和配置基准价等属性。

关联车型配置维表关联车型配置维表

关联后,确认主表行数未减少,且车型配置属性已经补充。

查看车型配置关联结果查看车型配置关联结果

融合城市环境信息

先检查城市环境维表的城市键唯一且关键字段无缺失,再按「城市」左连接至车评数据,补充年平均气温、地形起伏度和人均 GDP 等环境字段。

检查城市环境维表检查城市环境维表

关联城市环境信息关联城市环境信息

完成后,核对输出行数、关联覆盖率和城市匹配状态。

验证城市环境关联结果验证城市环境关联结果

构造分析指标

基于融合后的宽表,生成续航达成率、温度偏离、低温缺口、高温超额和购车负担比等基础指标;再生成温度分箱、GDP 四分位、地形分组和有序情感等级等分组分析字段。

构造基础分析指标构造基础分析指标

构造分组分析指标构造分组分析指标

检查关联与主表质量

检查城市、气温、地形、人均 GDP 和车型配置的关联缺失情况;再检查口碑 ID 重复、关键字段空值、城市样本量、文本长度和情感分布。

检查关联覆盖率检查关联覆盖率

检查主表质量检查主表质量

创建分析图表

使用分析宽表创建图表,观察样例数据的分布、主题构成和分组差异。

续航达成率分布直方图续航达成率分布直方图

NER 主题构成饼图NER 主题构成饼图

温度、地形与续航三维散点图温度、地形与续航三维散点图

温度区间与续航达成率折线图温度区间与续航达成率折线图

GDP 分组与购车价柱状图GDP 分组与购车价柱状图

主题与情感分布小提琴图主题与情感分布小提琴图

情感等级与评论字数箱线图情感等级与评论字数箱线图

训练并部署续航达成率回归模型

基于分析宽表创建回归预测任务,将「续航达成率」设为目标变量。在特征处理中,对数值特征使用自动缩放,并保留缺失值处理设置。

配置续航达成率模型特征处理配置续航达成率模型特征处理

完成训练后,查看模型指标和特征重要性;本方案选择 Ridge 模型进行部署。

查看续航达成率模型训练结果查看续航达成率模型训练结果

部署续航达成率模型部署续航达成率模型

训练并部署实测续航回归模型

在流程中从分析宽表发起回归预测任务,将「实测续航_公里」设为目标变量,并选择自动机器学习的快速模式。

从分析宽表发起实测续航回归任务从分析宽表发起实测续航回归任务

新建实测续航回归任务新建实测续航回归任务

训练完成后,比较算法结果并选择表现合适的模型。当前训练结果中 Ridge 模型的 R² 为 0.892。

查看实测续航模型训练结果查看实测续航模型训练结果

部署实测续航模型部署实测续航模型

部署完成后,可在流程画布中查看生成的实测续航回归模型节点。

查看实测续航模型流程结果查看实测续航模型流程结果

方案总结

本解决方案将用户车评、车型配置和城市环境数据整理为统一分析宽表,建立了从非结构化文本到结构化指标、从多源数据关联到质量验证、从描述性图表到回归建模的完整分析链路。通过对关联覆盖率、主表重复值和关键字段缺失的检查,保障后续分析和建模建立在一致、可用的数据基础上。

融合后的数据可用于识别不同温度区间、地形条件、车型配置和用户关注主题下的续航表现差异,也可用于观察评论情感与使用体验之间的分布特征。方案中提供的直方图、饼图、三维散点图、折线图、柱状图、小提琴图和箱线图,为业务人员从多个角度理解用户反馈和车辆使用环境提供直观依据。

在此基础上,方案分别训练并部署续航达成率与实测续航的回归模型。模型能够为后续续航分析、用户体验研究和产品运营中的数据驱动决策提供参考;在实际业务中,可结合新增用户数据、车型数据和环境数据持续更新分析宽表与模型,实现更贴近业务场景的分析和预测。