对象存储

  • 对象存储 > 使用指南 > 开发指南 > 多模态数据发现与处理 > 多模态理解

    多模态理解

    最近更新时间: 2026-09-17 16:11:28

    简介

    Kodo 数据工作流现已支持接入多模态理解能力,可在对象上传后、指定文件处理时或进行存量数据补处理时,批量分析空间中的图片和视频。

    您可以在工作流模板中编排图片理解、视频理解节点,选择适合业务的多模态大模型并设置提示词,为文件自动生成内容描述、标题、摘要、标签及业务所需的结构化信息。处理结果可按配置写入指定的 Kodo 空间和路径,供内容管理、搜索检索、数据分析等后续系统使用。

    通过将多模态理解纳入数据工作流,您可以把素材入库、内容分析和结果归档串联为统一流程,降低重复处理成本,并让新增数据与历史数据采用一致的处理标准。

    常见场景

    场景适用说明
    媒资内容管理对图片和视频素材自动理解按指定要求生成如标题、摘要、标签等数据并存储,提升素材归档、分类和检索效率。
    内容搜索与推荐将理解结果保存为结构化数据,为全文检索、语义检索、内容推荐及素材筛选提供数据基础。
    视频内容分析对视频生成内容概述、关键主题或业务关注信息,便于快速了解视频内容并进行后续处理。
    UGC 素材处理对持续上传的用户素材自动执行统一分析流程,减少人工整理和重复标注工作。
    存量数据补处理针对空间内已有文件按需创建任务,分批补充描述、标签或其他业务字段。
    业务数据提取通过自定义提示词提取图片或视频中的业务信息,并以 JSON 结果保存便于后续供数据库、分析平台或业务系统消费。

    功能优势

    • 多模型选择:可按业务需求选择多模态大模型。模型能力、可用范围及价格请参见可选模型与能力
    • 工作流编排处理:多模态理解作为数据工作流节点,可与转码、截图、图片处理等多媒体处理能力组合编排。已支持能力请参见多媒体数据处理能力
    • 适配不同处理节奏:既可随文件上传自动执行,也可在控制台对指定对象或历史数据按需创建任务。
    • 统一结果沉淀:理解结果由工作流输出节点写入指定空间和路径,便于与内容管理、搜索、告警、数据库及数据分析系统集成。
    • 提示词驱动的业务输出:可通过自定义提示词约束分析重点和输出字段,使模型结果更贴合具体业务场景。
    • 继承数据工作流能力:支持串并行编排、条件触发等数据工作流特性。详情请参见数据工作流

    支持的多模态理解能力

    处理能力适用对象说明
    图片理解图片文件使用多模态大模型和自定义提示词分析图片内容,生成描述、标签或结构化信息。
    视频理解视频文件使用多模态大模型和自定义提示词分析视频内容,生成摘要、主题或结构化信息。

    使用前须知

    本功能当前处于公测阶段。如需在控制台使用,请先提交工单申请开通。

    使用前,您需要开通多模态理解服务,以授权 Kodo 创建并使用七牛 AI 大模型服务下命名为 dataInsight 的 API Key。开通后,您可在 Kodo 控制台的数据工作流中创建并使用图片理解、视频理解节点。

    多模态理解以数据工作流节点的形式使用,您可能需要先完整了解数据工作流功能

    快速使用

    您可以在控制台完成以下流程:

    1. 创建数据工作流模板,按处理对象选择图片理解或视频理解节点。
    2. 在节点中选择模型并设置提示词,明确希望模型关注的内容及预期输出。
    3. 配置工作流输出,将理解结果保存至指定空间和路径。
    4. 根据业务场景选择任务发起方式:上传自动触发、上传时指定工作流,或对已有对象手动创建任务。
    5. 在任务管理中查看处理状态,并在输出位置获取结果文件。

    使用示例

    某内容团队需要管理空间中的图片和视频素材,并希望为新增素材和历史素材统一生成标题、摘要、标签及可检索的结构化信息。

    团队可以创建一个包含图片理解或视频理解节点的工作流模板,在提示词中约定所需字段,例如素材标题、内容摘要、主题标签和业务分类;再将结果以 JSON 文件写入指定路径。

    对于持续新增的素材,可为目标空间创建任务触发器。符合输入路径及过滤规则的对象上传后,会自动执行关联的工作流。对于存量文件、试运行文件或需要重新分析的指定对象,可在控制台文件列表或任务管理中手动创建多媒体任务。

    这样,新增数据与历史数据能够使用同一套模型、提示词和输出规则处理,方便后续系统稳定消费分析结果。

    任务发起方式

    上传自动触发

    适用于持续上传的图片或视频素材。

    在目标空间的「任务与工作流 > 任务触发器」中创建触发器,设置输入路径和过滤规则,并关联已创建的多模态理解工作流模板。开启后,符合规则的新对象会自动执行该工作流。

    上传时指定工作流

    适用于需要人工上传、但希望在上传后立即处理的素材。

    在控制台上传文件时指定工作流模板。对象写入空间后,将按照该模板执行多模态理解及后续编排的处理节点。

    手动创建任务

    适用于试运行、指定对象处理和历史数据补处理。

    您可以在控制台空间文件列表中,针对具体文件选择「创建多媒体任务」并指定工作流模板;也可以在「任务与工作流 > 任务管理」中为指定文件新建任务。

    获取与使用处理结果

    多模态理解结果由工作流输出节点写入您配置的目标空间和路径。结果通常包含实际使用的模型、生成内容、完成原因和 Token 用量等信息;具体字段及内容由所选模型和提示词共同决定。

    如需由业务系统自动消费结果,建议在提示词中明确以下内容:

    • 需要输出的字段名称及字段类型。
    • 每个字段的内容要求和取值范围。
    • 无法判断、内容缺失或不适用时的统一取值。
    • 是否仅输出 JSON 结构,避免附加说明文本。

    建议业务侧对结果文件进行格式校验,并为模型输出字段预留兼容处理,以适配不同模型或提示词版本带来的内容差异。

    计量计费与服务限制

    • 多模态模型调用消耗将按实际使用的模型,计入 AI 大模型推理服务账号。模型能力、价格和可用范围以模型列表为准。
    • 调用多模态大模型理解空间中的资源时,可能产生外网流出流量。详情请参见计量项与计费项
    • 工作流中使用的多媒体处理能力,按智能多媒体服务规则计费。详情请参见计费项
    • 工作流模板、任务触发器和预设集的数量限制,请参见使用限制说明
    以上内容是否对您有帮助?