数据处理
智能数据处理
智能数据处理支持通过自然语言描述处理要求,对数据集和文件夹中的内容进行读取、清洗、统计、转换与信息提取。根据处理目标,可以生成结构化数据集,也可以将文本、图片及其他文件写入输出文件夹。
创建智能数据处理任务
在「流程」中选中需要处理的数据集或文件夹节点,点击右侧的【智能数据处理】。
智能数据处理入口
在「智能数据处理」弹窗中核对输入。如需添加其他输入,可点击输入区域的【新增】。
在输出区域点击【新增】,根据处理需求逐个创建输出。结构化表格可使用输出数据集承接,文本、图片、文档等文件可保存到输出文件夹。输出类型和数量按实际需要确定。
核对输入和输出,点击【确认】进入智能数据处理页面。
智能数据处理输入与输出配置
查看输入并描述处理要求
在「智能体」页面中,左侧用于输入处理要求和查看回复,右侧提供「输入内容」「输出结果」和「脚本」页签。
切换到「输入内容」查看待处理数据。输入为文件夹时,可按目录浏览文件,选择文件查看预览,也可通过【快速过滤当前目录】定位文件。
在左下方输入框中用自然语言描述处理要求,按回车发送。智能体会结合输入内容开展处理,并在对话中反馈进展和结果。
智能体对话与输入内容
描述要求时,应说明需要处理的数据、具体规则和期望的输出。涉及多个输入时,应明确各输入之间的关系;涉及多个输出时,应说明每个输出应包含的内容。
查看处理结果
处理完成后,在左侧回复中查看总结。切换到「输出结果」,选择需要查看的输出,可浏览生成的文件并查看预览,核对处理结果是否符合处理要求。
输出结果浏览与文件预览
检查输出内容是否完整、是否存在遗漏或重复,并结合原始数据确认结果。需要将文件保存到本地时,可使用预览区域的【下载】。
继续调整处理要求
需要修改处理逻辑时,可在左下方继续输入要求,说明需要调整的规则或输出内容。处理完成后,重新查看「输出结果」,确认修改是否符合预期。
也可在「脚本」中查看处理代码和历史版本。进入编辑状态修改代码后,点击【保存】可保存为新版本;点击【运行】会执行最新版本的脚本,存在未保存的编辑时会先保存再运行。仅切换历史版本查看不会改变运行所用的版本。
对话已完成处理并生成结果后,无需再次点击【运行】;需要重新执行处理逻辑时再运行。
调整处理要求可能更新或替换已有输出。如需保留当前文件,应先下载保存;不同处理目标也可分别创建任务。
支持的处理能力
智能数据处理支持以下常见任务。不同格式的读取、转换和输出范围各有差异,应结合文件内容提出具体要求。
| 数据类别 | 常见格式 | 处理能力 |
|---|---|---|
| 表格数据 | CSV、TSV、XLSX | 编码转换、缺失值处理、去重、类型修正、统计分析、分组聚合、异常检测、训练集与测试集划分、多格式导出。 |
| 结构化数据 | JSON、JSONL、YAML、XML、GeoJSON | 字段和节点提取、嵌套结构展开、筛选统计、转换为表格。 |
| 二进制与科学数据 | Parquet、Feather、SQLite、NPY、NPZ、HDF5、MAT、NetCDF | 表和层级结构读取、查询、数组运算、切片及统计。 |
| 图像 | PNG、JPEG、BMP、WebP、TIFF、GIF | 缩放、裁剪、旋转、格式转换、像素与元数据统计、多页拆分、动画帧提取、文字和表格 OCR。 |
| 文档 | PDF、DOCX | PDF 文本与表格提取、扫描 PDF OCR、DOCX 段落和表格读取及内嵌图片导出。 |
| 文本 | Markdown、纯文本、日志、HTML | 编码转换、行级过滤与统计、正文和链接提取。 |
| 音视频 | WAV、MP3、OGG、FLAC、MP4、WebM、SRT | 音视频转码、时长及元数据读取、响度分析、视频抽帧、字幕提取与格式转换。 |
| 压缩文件 | ZIP、TAR.GZ、Gzip | 查看归档内容、解包、按需读取文件、过滤元数据条目。 |
SVG 支持解析结构及提取文字、路径等元素,不支持渲染为位图;TOML 仅适用于简单结构的处理。音视频能力主要用于转码、抽帧和分析。对于空文件或损坏文件,应根据处理回复查看空数据结论或错误原因,再调整输入。
使用平台内置 OCR
平台内置 OCR(光学字符识别)能力,智能数据处理可调用该能力识别扫描 PDF 和图片中的文字、表格及版面信息。用户可直接在对话中提出文档读取或内容提取要求,将识别结果用于后续数据处理。
在「输入内容」中选择目标文件,预览其内容,并在对话中说明需要提取的文字、表格或其他信息。带有文字层的 PDF 可以直接提取内容;扫描 PDF 和图片中的内容则通过 OCR 识别。
文档输入预览与处理对话
识别结果可生成 .dtocr 文档包。在「输出结果」中打开文档包,可通过「标注结果」对照原始页面查看标题、正文、表格等标注信息,界面还提供「文档阅读」和「详细数据」页签。
文档识别结果与版面标注
根据处理要求,提取的正文可保存为文本文件,表格可写入输出数据集,用于后续筛选、统计和分析。
获取文件列表
获取文件列表用于将文件夹中的文件信息转换为结构化数据集。系统会扫描文件夹中的文件,并生成包含文件路径、文件名称、文件类型、文件大小和分类标签等信息的文件列表,为图像处理、模型训练和预测任务提供标准化输入。
在流程页面中选中已导入的文件夹节点,右侧会展开对应的算子列表。点击【获取文件列表】,即可创建文件列表转换任务。
创建获取文件列表任务
在文件夹层级匹配中,配置需要提取的文件夹层级,并设置对应的输出列名。系统会读取相应层级的目录名称,并生成结构化标签字段。
配置文件夹层级匹配
点击【运行】。任务运行完成后返回流程页面,生成的数据集会显示在流程画布中。
查看生成的数据集
图像标注
图像标注用于为图片添加图像分类标签,或为目标检测任务标记目标位置。
创建图像标注任务
选择标注任务类型
在「数据」中确认待标注图片已上传到图像文件夹,并准备好对应的文件列表数据集。
查看图像文件夹和文件列表
进入「流程」,选中文件列表数据集,在右侧「通用方法」中点击【数据标注】。
在流程中选中文件列表数据集
在“选择标注任务类型”弹窗中,按标注目标选择【图像分类】或【目标检测】。
选择图像分类任务类型
配置任务输入和输出
在“数据标注”弹窗中,选择「元数据集」和与其图片路径对应的「图像文件夹」,填写输出数据集名称。确认输入、文件夹和输出配置后,点击【确认】创建任务。
配置图像分类任务的输入和输出
配置图像分类字段和类别
创建图像分类任务后,进入「设置」页。在“标注配置”中将「图像路径列」设为文件列表中保存图片路径的字段,并填写输出标注列名称。在“标注类别”中添加或调整本任务需要的分类类别,确认配置后点击【保存】。
配置图像路径列和分类类别
在工作区完成分类标注
切换到「工作区」,在右侧选择当前图片对应的类别,点击【保存并下一张】保存标注并进入下一张图片。按相同方式为队列中的图片选择类别。
在工作区选择图像分类类别
审核并运行标注任务
切换到「审核」,检查图片与类别标签是否对应。确认后,点击页面底部的【运行】。
审核图像分类结果
等待任务运行完成,然后返回「流程」查看标注节点和输出数据集。
运行图像分类标注任务
输出数据集显示在「流程」画布中,并连接到对应的图像标注节点。
查看图像分类标注流程
在工作区完成目标检测标注
进入已配置的目标检测任务「工作区」,先选择目标类别,再在图片中的目标区域拖动绘制矩形框。右侧“矩形框”列表会显示已绘制的框及对应类别。检查框选范围和类别后,点击【保存并下一张】保存当前标注并继续处理。
在目标检测工作区绘制矩形框
