数据处理

智能数据处理

智能数据处理支持通过自然语言描述处理要求,对数据集和文件夹中的内容进行读取、清洗、统计、转换与信息提取。根据处理目标,可以生成结构化数据集,也可以将文本、图片及其他文件写入输出文件夹。

创建智能数据处理任务

在「流程」中选中需要处理的数据集或文件夹节点,点击右侧的【智能数据处理】。

智能数据处理入口智能数据处理入口

在「智能数据处理」弹窗中核对输入。如需添加其他输入,可点击输入区域的【新增】。

在输出区域点击【新增】,根据处理需求逐个创建输出。结构化表格可使用输出数据集承接,文本、图片、文档等文件可保存到输出文件夹。输出类型和数量按实际需要确定。

核对输入和输出,点击【确认】进入智能数据处理页面。

智能数据处理输入与输出配置智能数据处理输入与输出配置

查看输入并描述处理要求

在「智能体」页面中,左侧用于输入处理要求和查看回复,右侧提供「输入内容」「输出结果」和「脚本」页签。

切换到「输入内容」查看待处理数据。输入为文件夹时,可按目录浏览文件,选择文件查看预览,也可通过【快速过滤当前目录】定位文件。

在左下方输入框中用自然语言描述处理要求,按回车发送。智能体会结合输入内容开展处理,并在对话中反馈进展和结果。

智能体对话与输入内容智能体对话与输入内容

描述要求时,应说明需要处理的数据、具体规则和期望的输出。涉及多个输入时,应明确各输入之间的关系;涉及多个输出时,应说明每个输出应包含的内容。

查看处理结果

处理完成后,在左侧回复中查看总结。切换到「输出结果」,选择需要查看的输出,可浏览生成的文件并查看预览,核对处理结果是否符合处理要求。

输出结果浏览与文件预览输出结果浏览与文件预览

检查输出内容是否完整、是否存在遗漏或重复,并结合原始数据确认结果。需要将文件保存到本地时,可使用预览区域的【下载】。

继续调整处理要求

需要修改处理逻辑时,可在左下方继续输入要求,说明需要调整的规则或输出内容。处理完成后,重新查看「输出结果」,确认修改是否符合预期。

也可在「脚本」中查看处理代码和历史版本。进入编辑状态修改代码后,点击【保存】可保存为新版本;点击【运行】会执行最新版本的脚本,存在未保存的编辑时会先保存再运行。仅切换历史版本查看不会改变运行所用的版本。

对话已完成处理并生成结果后,无需再次点击【运行】;需要重新执行处理逻辑时再运行。

调整处理要求可能更新或替换已有输出。如需保留当前文件,应先下载保存;不同处理目标也可分别创建任务。

支持的处理能力

智能数据处理支持以下常见任务。不同格式的读取、转换和输出范围各有差异,应结合文件内容提出具体要求。

数据类别常见格式处理能力
表格数据CSV、TSV、XLSX编码转换、缺失值处理、去重、类型修正、统计分析、分组聚合、异常检测、训练集与测试集划分、多格式导出。
结构化数据JSON、JSONL、YAML、XML、GeoJSON字段和节点提取、嵌套结构展开、筛选统计、转换为表格。
二进制与科学数据Parquet、Feather、SQLite、NPY、NPZ、HDF5、MAT、NetCDF表和层级结构读取、查询、数组运算、切片及统计。
图像PNG、JPEG、BMP、WebP、TIFF、GIF缩放、裁剪、旋转、格式转换、像素与元数据统计、多页拆分、动画帧提取、文字和表格 OCR。
文档PDF、DOCXPDF 文本与表格提取、扫描 PDF OCR、DOCX 段落和表格读取及内嵌图片导出。
文本Markdown、纯文本、日志、HTML编码转换、行级过滤与统计、正文和链接提取。
音视频WAV、MP3、OGG、FLAC、MP4、WebM、SRT音视频转码、时长及元数据读取、响度分析、视频抽帧、字幕提取与格式转换。
压缩文件ZIP、TAR.GZ、Gzip查看归档内容、解包、按需读取文件、过滤元数据条目。

SVG 支持解析结构及提取文字、路径等元素,不支持渲染为位图;TOML 仅适用于简单结构的处理。音视频能力主要用于转码、抽帧和分析。对于空文件或损坏文件,应根据处理回复查看空数据结论或错误原因,再调整输入。

使用平台内置 OCR

平台内置 OCR(光学字符识别)能力,智能数据处理可调用该能力识别扫描 PDF 和图片中的文字、表格及版面信息。用户可直接在对话中提出文档读取或内容提取要求,将识别结果用于后续数据处理。

在「输入内容」中选择目标文件,预览其内容,并在对话中说明需要提取的文字、表格或其他信息。带有文字层的 PDF 可以直接提取内容;扫描 PDF 和图片中的内容则通过 OCR 识别。

文档输入预览与处理对话文档输入预览与处理对话

识别结果可生成 .dtocr 文档包。在「输出结果」中打开文档包,可通过「标注结果」对照原始页面查看标题、正文、表格等标注信息,界面还提供「文档阅读」和「详细数据」页签。

文档识别结果与版面标注文档识别结果与版面标注

根据处理要求,提取的正文可保存为文本文件,表格可写入输出数据集,用于后续筛选、统计和分析。

获取文件列表

获取文件列表用于将文件夹中的文件信息转换为结构化数据集。系统会扫描文件夹中的文件,并生成包含文件路径、文件名称、文件类型、文件大小和分类标签等信息的文件列表,为图像处理、模型训练和预测任务提供标准化输入。

在流程页面中选中已导入的文件夹节点,右侧会展开对应的算子列表。点击【获取文件列表】,即可创建文件列表转换任务。

创建获取文件列表任务创建获取文件列表任务

在文件夹层级匹配中,配置需要提取的文件夹层级,并设置对应的输出列名。系统会读取相应层级的目录名称,并生成结构化标签字段。

配置文件夹层级匹配配置文件夹层级匹配

点击【运行】。任务运行完成后返回流程页面,生成的数据集会显示在流程画布中。

查看生成的数据集查看生成的数据集

图像标注

图像标注用于为图片添加图像分类标签,或为目标检测任务标记目标位置。

创建图像标注任务

选择标注任务类型

在「数据」中确认待标注图片已上传到图像文件夹,并准备好对应的文件列表数据集。

查看图像文件夹和文件列表查看图像文件夹和文件列表

进入「流程」,选中文件列表数据集,在右侧「通用方法」中点击【数据标注】。

在流程中选中文件列表数据集在流程中选中文件列表数据集

在“选择标注任务类型”弹窗中,按标注目标选择【图像分类】或【目标检测】。

选择图像分类任务类型选择图像分类任务类型

配置任务输入和输出

在“数据标注”弹窗中,选择「元数据集」和与其图片路径对应的「图像文件夹」,填写输出数据集名称。确认输入、文件夹和输出配置后,点击【确认】创建任务。

配置图像分类任务的输入和输出配置图像分类任务的输入和输出

配置图像分类字段和类别

创建图像分类任务后,进入「设置」页。在“标注配置”中将「图像路径列」设为文件列表中保存图片路径的字段,并填写输出标注列名称。在“标注类别”中添加或调整本任务需要的分类类别,确认配置后点击【保存】。

配置图像路径列和分类类别配置图像路径列和分类类别

在工作区完成分类标注

切换到「工作区」,在右侧选择当前图片对应的类别,点击【保存并下一张】保存标注并进入下一张图片。按相同方式为队列中的图片选择类别。

在工作区选择图像分类类别在工作区选择图像分类类别

审核并运行标注任务

切换到「审核」,检查图片与类别标签是否对应。确认后,点击页面底部的【运行】。

审核图像分类结果审核图像分类结果

等待任务运行完成,然后返回「流程」查看标注节点和输出数据集。

运行图像分类标注任务运行图像分类标注任务

输出数据集显示在「流程」画布中,并连接到对应的图像标注节点。

查看图像分类标注流程查看图像分类标注流程

在工作区完成目标检测标注

进入已配置的目标检测任务「工作区」,先选择目标类别,再在图片中的目标区域拖动绘制矩形框。右侧“矩形框”列表会显示已绘制的框及对应类别。检查框选范围和类别后,点击【保存并下一张】保存当前标注并继续处理。

在目标检测工作区绘制矩形框在目标检测工作区绘制矩形框