数据处理
智能数据处理
智能数据处理用于通过自然语言指令加工结构化表格数据。用户无需编写脚本,只需说明输入表、处理规则和输出要求,即可完成单表处理、多表关联、结果拆分等任务,并生成一个或多个输出数据集。
创建智能数据处理任务
在流程页面中选中需要处理的数据集节点,右侧会展开可用的算子列表。点击【智能数据处理】,即可创建智能数据处理任务。
创建智能数据处理任务
在弹窗中确认输入数据集和输出数据集。点击【新增】可以添加数据集;如果任务需要生成多个结果,应在此处预先配置相应数量的输出数据集。配置完成后点击【确认】,进入智能数据处理页面。
配置输入和输出数据集
支持的处理能力
智能数据处理支持以下常见的表格数据处理任务。
筛选与字段处理
按条件筛选记录,选择、删除或重排字段,规范字段名称和输出结构。
例如,筛选合格生产批次并调整输出字段时,可以这样描述:
从 production_batches 表里找出产量超过 100 且没有不良品的批次。
结果里只保留批次号、设备编号和产量,把产量这一列改叫 qualified_qty,并按设备编号、批次号、合格产量的顺序展示。
计算与分类
使用已有字段进行四则运算、比例或差值计算,并按条件生成分类、标签、优先级或异常原因。
例如,计算生产批次的不良率并进行分类时,可以这样描述:
计算 production_batches 表中每个批次的不良率,用不良数除以产量。
不良率超过 5% 的批次标记为“需关注”,其他标记为“正常”。
数据清洗
按固定值、均值或分组均值填充缺失值;按单字段或组合业务规则去重等清洗功能。
例如,填充缺失值并去除重复生产批次时,可以这样描述:
清洗 production_batches 表:产量缺失时,用同一台设备的平均产量补上;不良数缺失时按 0 处理。
如果同一设备下有重复的批次号,只保留最新的一条记录。
分组聚合
按一个或多个字段分组,计算求和、平均值、最小值、最大值、计数和标准差等指标。
例如,按设备汇总生产批次时,可以这样描述:
请按设备汇总 production_batches 表,看看每台设备一共生产了多少批、总产量是多少、不良品总数是多少。
结果中包含设备编号、批次数、总产量和不良品总数。
表结构转换
执行长表转宽表(Pivot)或宽表转长表(Unpivot),并按规则生成输出字段名。
例如,将生产批次数据从长表转换为宽表时,可以这样描述:
请把 production_batches 表整理成“一台设备一行”的宽表。
每个批次号展开成一列,列里填对应的产量;这样我可以直接看到每台设备在各个批次的产量。
窗口计算
按字段分区和排序,计算排名、累计值、上一条或下一条记录,以及首值和末值。
例如,计算每台设备生产批次的排名和累计产量时,可以这样描述:
请按设备查看 production_batches 表,并按照批次号从小到大排序。
我想知道每个批次是这台设备的第几个批次、截至当前批次的累计产量,以及上一批次的产量。
多表处理
按一个或多个字段进行关联,也可按实体和时间区间进行时间窗口匹配。
例如,为生产批次补充设备信息时,可以这样描述:
给 production_batches 表补充设备信息。
按设备编号关联 equipment_info 表,保留所有生产批次,并带出设备名称和车间信息。结果中需要有批次号、设备编号、设备名称、车间、产量和不良数。
差异比对
对新旧数据集进行比较,识别新增记录、变化记录并计算差值。
例如,比较新旧生产批次数据的变化时,可以这样描述:
比较 production_batches_old 和 production_batches_new 这两份数据,按批次号对应。
找出新增加的批次,以及产量或不良数有变化的批次;同时告诉我产量具体增加或减少了多少。结果里要能看出变化类型,以及新旧产量和不良数。
多输出处理
按制定规则将一张表拆分为多个结果,并将正常、异常、未匹配、新增或变化记录分别写入已配置的输出数据集。
例如,将合格和不合格生产批次分别写入不同数据集时,可以这样描述:
请把 production_batches 表分成两份结果:没有不良品的批次放到 qualified_batches,有不良品的批次放到 defective_batches。
两份结果都保留批次号、设备编号、产量和不良数。
流程编排
组合筛选、计算、关联、聚合、拆分等多个步骤,完成连续的数据加工流程。
例如,依次完成筛选、计算、关联、汇总和拆分时,可以这样描述:
处理 production_batches 表:先去掉产量为 0 的记录,再算出每个批次的不良率。
然后按设备编号关联 equipment_info 表,补充设备名称,并按设备汇总总产量和不良品总数。最后把不良率超过 5% 的设备放到 attention_equipment,其余设备放到 normal_equipment。
编写处理需求时请注意:
- 表名和字段名应与输入数据集保持一致。
- 多表关联时,应明确说明每一组关联字段和关联方式。
- 分组汇总时,应说明分组字段、参与聚合的字段和聚合方式。
- 生成多个输出结果时,应分别说明每个结果的筛选或处理规则。
- 输出数据集的数量和名称应与处理结果的数量对应;生成多个结果前,请先配置相应数量的输出数据集。
注意: 上述内容用于说明常用场景,不代表智能数据处理能力的全部范围。对于其他处理需求,也可以用自然语言说明输入数据、处理规则和输出要求。智能数据处理会根据输入内容生成处理逻辑和输出结果;提交任务后,应在【输出数据集】中核对输出行数、字段和值。涉及关键业务判断、计算结果或对外使用的数据时,还应结合原始数据和业务规则确认结果是否正确。
运行并查看结果
提交处理需求后,智能体会根据指令生成或更新处理脚本并执行任务。处理完成后,可在右侧【输出数据集】中预览结果,确认输出行数、字段和值是否符合要求。
查看智能数据处理结果
切换至【脚本】页签,可查看当前生成的处理脚本及运行结果。
查看生成的处理脚本
继续调整处理要求
如需继续调整处理逻辑,可在页面左下方输入新的处理要求并发送。处理逻辑保存后,可在【脚本】页签右上方的版本列表中查看已保存的版本;选择相应版本后,可查看该版本的处理脚本。
查看处理逻辑版本
获取文件列表
获取文件列表用于将文件夹中的文件信息转换为结构化数据集。系统会扫描文件夹中的文件,并生成包含文件路径、文件名称、文件类型、文件大小和分类标签等信息的文件列表,为图像处理、模型训练和预测任务提供标准化输入。
在流程页面中选中已导入的文件夹节点,右侧会展开对应的算子列表。点击【获取文件列表】,即可创建文件列表转换任务。
创建获取文件列表任务
在文件夹层级匹配中,配置需要提取的文件夹层级,并设置对应的输出列名。系统会读取相应层级的目录名称,并生成结构化标签字段。
配置文件夹层级匹配
点击【运行】。任务运行完成后返回流程页面,生成的数据集会显示在流程画布中。
查看生成的数据集
