汽车之家案例——智能数据处理提示词汇总

说明：以下为本案例在“智能数据处理”节点中使用的自然语言提示词，按实际处理顺序整理。图表和回归模型通过界面配置字段、指标和算法完成，不涉及智能数据处理提示词。

1. 原始车评文本质量检查

检查“网友车评”中的空文本、重复文本、异常编码和过短文本。保留原始文本，并输出有效车评文本集。


2. 车评事实字段抽取

从每条“网友车评”中识别并新增以下字段：口碑ID、城市、车型、车型配置、购买月份、行驶里程_km、季节电耗_kWh每100km、季节续航_公里、裸车购买价_万元、测评环境温度_℃、高速里程占比、激进驾驶指数、平均载重_kg、热泵空调、低温预热习惯、空间、驾驶感受、续航、外观、内饰、性价比、智能化。保留原始“网友车评”列；无法可靠识别的值保留为空，不猜测。


3. 主题、情感与评论字数抽取

基于“网友车评”中的“用车感受”正文及七项评分，新增NER_主主题、情感分数、情感标签和评论字数。NER_主主题仅在续航、充电、空间、驾驶、智能化、舒适性、性价比中选择一个；主题和情感以“用车感受”正文及评分为主；标题式的“季节续航”仅作为数值实体，不要因为字段名包含“续航”而全部评论判为续航主题；无法可靠识别的值保留为空，不猜测。


4. 城市、车型和车型配置标准化

标准化城市、车型和车型配置：去除多余空格、后缀和无效字符；统一“广州”“广州市”等城市别名；将车型和车型配置名称统一为车型配置维表中的标准名称。无法可靠匹配的值不强行替换，保留原值并标记为未匹配。


5. 车型配置属性关联

使用“车型”和“车型配置”同时相等的条件，将车评与车型配置维表关联。为每条车评补充标称续航_公里、电池容量_kWh、配置等级、全轮驱动和配置基准价_万元。保留全部车评记录；找不到对应配置时保留为空并标记未匹配。


6. 城市环境维表检查

检查城市环境维表：确认每个城市只有一行；检查年平均气温_2001_2022_℃、地形起伏度和2025年人均GDP_元是否存在缺失；确认上述关键字段均为数值类型。输出城市环境维表检查结果。


7. 城市环境信息融合

按“城市”将车评与城市环境维表关联，保留全部车评记录。补充年平均气温_2001_2022_℃、地形起伏度和2025年人均GDP_元；如城市无匹配，保留为空并标记未匹配。输出初步融合宽表。


8. 构造基础分析指标

将“季节续航_公里”统一命名为“实测续航_公里”。新增续航达成率，计算方式为实测续航_公里除以标称续航_公里；新增偏离舒适温度_绝对值，计算方式为测评环境温度_℃与22之差的绝对值；新增偏离舒适温度_平方、低温缺口和高温超额；新增购车负担比，计算方式为裸车购买价_万元乘以10000后除以2025年人均GDP_元。保留原始字段，并输出基础分析指标表。


9. 构造分组分析指标

将地形起伏度标准化到0到1之间。基于现有字段构造GDP四分位、地形三分位、5℃温度分箱和有序情感等级；保留原始字段和已构造的基础分析指标，输出分析宽表。


10. 关联质量检查

检查城市、气温、地形、GDP和车型配置的关联缺失；比较关联前后的行数；分别检查原始车型配置关联与剥离“2026款”前缀后的车型配置关联。输出关联质量检查结果。


11. 主表质量检查

检查分析宽表中的口碑ID是否重复、关键字段是否存在空值、城市样本量是否满足分析要求，并汇总文本长度和情感标签分布。确认主表没有因关联产生记录丢失、重复或关键字段缺失，输出主表质量检查结果。
