数据处理

智能数据处理

智能数据处理用于通过自然语言指令加工结构化表格数据。用户无需编写脚本,只需说明输入表、处理规则和输出要求,即可完成单表处理、多表关联、结果拆分等任务,并生成一个或多个输出数据集。

创建智能数据处理任务

在流程页面中选中需要处理的数据集节点,右侧会展开可用的算子列表。点击【智能数据处理】,即可创建智能数据处理任务。

创建智能数据处理任务创建智能数据处理任务

在弹窗中确认输入数据集和输出数据集。点击【新增】可以添加数据集;如果任务需要生成多个结果,应在此处预先配置相应数量的输出数据集。配置完成后点击【确认】,进入智能数据处理页面。

配置输入和输出数据集配置输入和输出数据集

支持的处理能力

智能数据处理支持以下常见的表格数据处理任务。

筛选与字段处理

按条件筛选记录,选择、删除或重排字段,规范字段名称和输出结构。

例如,筛选合格生产批次并调整输出字段时,可以这样描述:

从 production_batches 表里找出产量超过 100 且没有不良品的批次。

结果里只保留批次号、设备编号和产量,把产量这一列改叫 qualified_qty,并按设备编号、批次号、合格产量的顺序展示。

计算与分类

使用已有字段进行四则运算、比例或差值计算,并按条件生成分类、标签、优先级或异常原因。

例如,计算生产批次的不良率并进行分类时,可以这样描述:

计算 production_batches 表中每个批次的不良率,用不良数除以产量。

不良率超过 5% 的批次标记为“需关注”,其他标记为“正常”。

数据清洗

按固定值、均值或分组均值填充缺失值;按单字段或组合业务规则去重等清洗功能。

例如,填充缺失值并去除重复生产批次时,可以这样描述:

清洗 production_batches 表:产量缺失时,用同一台设备的平均产量补上;不良数缺失时按 0 处理。

如果同一设备下有重复的批次号,只保留最新的一条记录。

分组聚合

按一个或多个字段分组,计算求和、平均值、最小值、最大值、计数和标准差等指标。

例如,按设备汇总生产批次时,可以这样描述:

请按设备汇总 production_batches 表,看看每台设备一共生产了多少批、总产量是多少、不良品总数是多少。

结果中包含设备编号、批次数、总产量和不良品总数。

表结构转换

执行长表转宽表(Pivot)或宽表转长表(Unpivot),并按规则生成输出字段名。

例如,将生产批次数据从长表转换为宽表时,可以这样描述:

请把 production_batches 表整理成“一台设备一行”的宽表。

每个批次号展开成一列,列里填对应的产量;这样我可以直接看到每台设备在各个批次的产量。

窗口计算

按字段分区和排序,计算排名、累计值、上一条或下一条记录,以及首值和末值。

例如,计算每台设备生产批次的排名和累计产量时,可以这样描述:

请按设备查看 production_batches 表,并按照批次号从小到大排序。

我想知道每个批次是这台设备的第几个批次、截至当前批次的累计产量,以及上一批次的产量。

多表处理

按一个或多个字段进行关联,也可按实体和时间区间进行时间窗口匹配。

例如,为生产批次补充设备信息时,可以这样描述:

给 production_batches 表补充设备信息。

按设备编号关联 equipment_info 表,保留所有生产批次,并带出设备名称和车间信息。结果中需要有批次号、设备编号、设备名称、车间、产量和不良数。

差异比对

对新旧数据集进行比较,识别新增记录、变化记录并计算差值。

例如,比较新旧生产批次数据的变化时,可以这样描述:

比较 production_batches_old 和 production_batches_new 这两份数据,按批次号对应。

找出新增加的批次,以及产量或不良数有变化的批次;同时告诉我产量具体增加或减少了多少。结果里要能看出变化类型,以及新旧产量和不良数。

多输出处理

按制定规则将一张表拆分为多个结果,并将正常、异常、未匹配、新增或变化记录分别写入已配置的输出数据集。

例如,将合格和不合格生产批次分别写入不同数据集时,可以这样描述:

请把 production_batches 表分成两份结果:没有不良品的批次放到 qualified_batches,有不良品的批次放到 defective_batches。

两份结果都保留批次号、设备编号、产量和不良数。

流程编排

组合筛选、计算、关联、聚合、拆分等多个步骤,完成连续的数据加工流程。

例如,依次完成筛选、计算、关联、汇总和拆分时,可以这样描述:

处理 production_batches 表:先去掉产量为 0 的记录,再算出每个批次的不良率。

然后按设备编号关联 equipment_info 表,补充设备名称,并按设备汇总总产量和不良品总数。最后把不良率超过 5% 的设备放到 attention_equipment,其余设备放到 normal_equipment。

编写处理需求时请注意:

  • 表名和字段名应与输入数据集保持一致。
  • 多表关联时,应明确说明每一组关联字段和关联方式。
  • 分组汇总时,应说明分组字段、参与聚合的字段和聚合方式。
  • 生成多个输出结果时,应分别说明每个结果的筛选或处理规则。
  • 输出数据集的数量和名称应与处理结果的数量对应;生成多个结果前,请先配置相应数量的输出数据集。

注意: 上述内容用于说明常用场景,不代表智能数据处理能力的全部范围。对于其他处理需求,也可以用自然语言说明输入数据、处理规则和输出要求。智能数据处理会根据输入内容生成处理逻辑和输出结果;提交任务后,应在【输出数据集】中核对输出行数、字段和值。涉及关键业务判断、计算结果或对外使用的数据时,还应结合原始数据和业务规则确认结果是否正确。

运行并查看结果

提交处理需求后,智能体会根据指令生成或更新处理脚本并执行任务。处理完成后,可在右侧【输出数据集】中预览结果,确认输出行数、字段和值是否符合要求。

查看智能数据处理结果查看智能数据处理结果

切换至【脚本】页签,可查看当前生成的处理脚本及运行结果。

查看生成的处理脚本查看生成的处理脚本

继续调整处理要求

如需继续调整处理逻辑,可在页面左下方输入新的处理要求并发送。处理逻辑保存后,可在【脚本】页签右上方的版本列表中查看已保存的版本;选择相应版本后,可查看该版本的处理脚本。

查看处理逻辑版本查看处理逻辑版本

获取文件列表

获取文件列表用于将文件夹中的文件信息转换为结构化数据集。系统会扫描文件夹中的文件,并生成包含文件路径、文件名称、文件类型、文件大小和分类标签等信息的文件列表,为图像处理、模型训练和预测任务提供标准化输入。

在流程页面中选中已导入的文件夹节点,右侧会展开对应的算子列表。点击【获取文件列表】,即可创建文件列表转换任务。

创建获取文件列表任务创建获取文件列表任务

在文件夹层级匹配中,配置需要提取的文件夹层级,并设置对应的输出列名。系统会读取相应层级的目录名称,并生成结构化标签字段。

配置文件夹层级匹配配置文件夹层级匹配

点击【运行】。任务运行完成后返回流程页面,生成的数据集会显示在流程画布中。

查看生成的数据集查看生成的数据集