核心对象与工作流程

开始使用 DTEmpower 时,先了解项目中的核心对象及其关系,可以帮助你判断数据、处理任务和模型应该放在哪里,以及下一步应进入哪个模块。

核心对象

  • 项目:集中组织数据集、文件夹、流程、算子、实验和模型,承载数据处理、分析与建模工作。
  • 数据集:以字段和记录组织数据,用于查看、筛选、统计、处理和建模;也可通过路径和标注字段关联图像资源。
  • 文件夹:管理表格、文档、图像、音视频等文件,可直接作为智能数据处理的输入或输出,也可关联数据集参与图像训练和预测。
  • 流程:在画布中连接数据集、文件夹、算子和模型,组织数据处理、训练、评估与预测步骤。
  • 算子:执行数据处理、模型训练、评估或预测等操作的处理单元,按需配置输入、输出和参数。
  • 实验:配置模型训练、管理训练记录、比较候选模型和查看评估结果的工作空间。
  • 模型:从实验结果中选择并部署的模型,可查看版本和报告,用于后续预测或接口调用。
  • 运行中心:集中查看任务运行和数据质量状态,包含【任务】和【数据质量】两个入口。【任务】用于查看运行状态、耗时、关联流程和算子日志;【数据质量】用于查看项目中各数据集的质量检查状态。

对象如何协同

通常先在项目中导入数据集或文件夹,再通过流程中的算子完成数据处理或建模。智能数据处理可生成数据集或文件;机器学习任务在实验中配置和训练,完成后由用户查看评估结果、选择模型并部署。部署后的模型可用于后续预测或接口调用。运行过程中,可在顶部【运行中心】的【任务】中查看执行记录和算子日志,也可通过【数据质量】查看数据集的质量检查状态。

不同工作不一定需要经过所有对象。例如,只做数据查看或图表分析时,可以直接使用数据集;处理文档时,可以从文件夹创建智能数据处理任务;使用已有模型进行预测时,可以从待预测数据和模型开始组织流程。

推荐工作方式

  1. 创建项目,明确工作的业务目标和资源范围。
  2. 导入数据集或文件夹,并检查数据内容是否满足处理或建模需要。
  3. 在数据集详情中查看、排序或筛选数据;需要分析数据时,可按需创建图表。
  4. 根据任务需要,在流程中添加数据处理、机器学习或预测算子。
  5. 训练任务完成后,在实验中比较候选模型和评估结果。
  6. 选择符合预期的模型并部署,用于后续预测或接口调用。

执行过程中,可从顶部【运行中心】的【任务】查看运行状态和日志,或进入【数据质量】查看数据集质量状态;仅进行数据处理或分析时,无需继续训练和部署模型。