多模态理解
简介
Kodo 数据工作流现已支持接入多模态理解能力,可在对象上传后、指定文件处理时或进行存量数据补处理时,批量分析空间中的图片和视频。
您可以在工作流模板中编排图片理解、视频理解节点,选择适合业务的多模态大模型并设置提示词,为文件自动生成内容描述、标题、摘要、标签及业务所需的结构化信息。处理结果可按配置写入指定的 Kodo 空间和路径,供内容管理、搜索检索、数据分析等后续系统使用。
通过将多模态理解纳入数据工作流,您可以把素材入库、内容分析和结果归档串联为统一流程,降低重复处理成本,并让新增数据与历史数据采用一致的处理标准。
常见场景
| 场景 | 适用说明 |
|---|---|
| 媒资内容管理 | 对图片和视频素材自动理解按指定要求生成如标题、摘要、标签等数据并存储,提升素材归档、分类和检索效率。 |
| 内容搜索与推荐 | 将理解结果保存为结构化数据,为全文检索、语义检索、内容推荐及素材筛选提供数据基础。 |
| 视频内容分析 | 对视频生成内容概述、关键主题或业务关注信息,便于快速了解视频内容并进行后续处理。 |
| UGC 素材处理 | 对持续上传的用户素材自动执行统一分析流程,减少人工整理和重复标注工作。 |
| 存量数据补处理 | 针对空间内已有文件按需创建任务,分批补充描述、标签或其他业务字段。 |
| 业务数据提取 | 通过自定义提示词提取图片或视频中的业务信息,并以 JSON 结果保存便于后续供数据库、分析平台或业务系统消费。 |
功能优势
- 多模型选择:可按业务需求选择多模态大模型。模型能力、可用范围及价格请参见可选模型与能力。
- 工作流编排处理:多模态理解作为数据工作流节点,可与转码、截图、图片处理等多媒体处理能力组合编排。已支持能力请参见多媒体数据处理能力。
- 适配不同处理节奏:既可随文件上传自动执行,也可在控制台对指定对象或历史数据按需创建任务。
- 统一结果沉淀:理解结果由工作流输出节点写入指定空间和路径,便于与内容管理、搜索、告警、数据库及数据分析系统集成。
- 提示词驱动的业务输出:可通过自定义提示词约束分析重点和输出字段,使模型结果更贴合具体业务场景。
- 继承数据工作流能力:支持串并行编排、条件触发等数据工作流特性。详情请参见数据工作流。
支持的多模态理解能力
| 处理能力 | 适用对象 | 说明 |
|---|---|---|
| 图片理解 | 图片文件 | 使用多模态大模型和自定义提示词分析图片内容,生成描述、标签或结构化信息。 |
| 视频理解 | 视频文件 | 使用多模态大模型和自定义提示词分析视频内容,生成摘要、主题或结构化信息。 |
使用前须知
本功能当前处于公测阶段。如需在控制台使用,请先提交工单申请开通。
使用前,您需要开通多模态理解服务,以授权 Kodo 创建并使用七牛 AI 大模型服务下命名为 dataInsight 的 API Key。开通后,您可在 Kodo 控制台的数据工作流中创建并使用图片理解、视频理解节点。
多模态理解以数据工作流节点的形式使用,您可能需要先完整了解数据工作流功能。
快速使用
您可以在控制台完成以下流程:
- 创建数据工作流模板,按处理对象选择图片理解或视频理解节点。
- 在节点中选择模型并设置提示词,明确希望模型关注的内容及预期输出。
- 配置工作流输出,将理解结果保存至指定空间和路径。
- 根据业务场景选择任务发起方式:上传自动触发、上传时指定工作流,或对已有对象手动创建任务。
- 在任务管理中查看处理状态,并在输出位置获取结果文件。
使用示例
某内容团队需要管理空间中的图片和视频素材,并希望为新增素材和历史素材统一生成标题、摘要、标签及可检索的结构化信息。
团队可以创建一个包含图片理解或视频理解节点的工作流模板,在提示词中约定所需字段,例如素材标题、内容摘要、主题标签和业务分类;再将结果以 JSON 文件写入指定路径。
对于持续新增的素材,可为目标空间创建任务触发器。符合输入路径及过滤规则的对象上传后,会自动执行关联的工作流。对于存量文件、试运行文件或需要重新分析的指定对象,可在控制台文件列表或任务管理中手动创建多媒体任务。
这样,新增数据与历史数据能够使用同一套模型、提示词和输出规则处理,方便后续系统稳定消费分析结果。
任务发起方式
上传自动触发
适用于持续上传的图片或视频素材。
在目标空间的「任务与工作流 > 任务触发器」中创建触发器,设置输入路径和过滤规则,并关联已创建的多模态理解工作流模板。开启后,符合规则的新对象会自动执行该工作流。
上传时指定工作流
适用于需要人工上传、但希望在上传后立即处理的素材。
在控制台上传文件时指定工作流模板。对象写入空间后,将按照该模板执行多模态理解及后续编排的处理节点。
手动创建任务
适用于试运行、指定对象处理和历史数据补处理。
您可以在控制台空间文件列表中,针对具体文件选择「创建多媒体任务」并指定工作流模板;也可以在「任务与工作流 > 任务管理」中为指定文件新建任务。
获取与使用处理结果
多模态理解结果由工作流输出节点写入您配置的目标空间和路径。结果通常包含实际使用的模型、生成内容、完成原因和 Token 用量等信息;具体字段及内容由所选模型和提示词共同决定。
如需由业务系统自动消费结果,建议在提示词中明确以下内容:
- 需要输出的字段名称及字段类型。
- 每个字段的内容要求和取值范围。
- 无法判断、内容缺失或不适用时的统一取值。
- 是否仅输出 JSON 结构,避免附加说明文本。
建议业务侧对结果文件进行格式校验,并为模型输出字段预留兼容处理,以适配不同模型或提示词版本带来的内容差异。