Skip to main content

AIGC Pipeline

多模态 AI 内容生产流水线(AIGC Pipeline)底层平台

  • 基础设施层
  • 调度编排层
  • 智能决策层
  • 业务生产层

基础设施层

核心关键词: ComfyUI, Seedance/Wan/可灵/即梦 API, 算力成本优化, TypeScript/Python, Node.js

  • 说明:这是整个平台的地基。你需要对接各种底层的多模态生成大模型(文生图/图生视频/TTS)。这些模型有的可以通过API调用(如Seedance、可灵),有的需要本地部署(如ComfyUI)。同时需要极强的工程能力(TS/Python)来封装这些API,并进行算力成本优化,控制GPU等硬件的开销。

第二层:执行与状态层

核心关键词: Harness(插件体系), Cordis/Koishi, Temporal/Argo/Airflow, 断点续跑, 权限闸门, 审计日志

  • 说明:当底层模型封装好后,你需要一个“控制中心”来调度它们。Harness 充当了代理外壳,通过 Cordis/Koishi 插件体系将任务实例化。对于长耗时、复杂的生成任务(如电影级分镜),必须引入 TemporalArgo 这类工作流引擎,负责状态机管理。这一层要解决工程实际问题:任务执行到一半崩溃了要能断点续跑(Temporal擅长此道),并设置权限闸门(谁有权限调用昂贵的视频模型)和审计日志(记录每次操作)。

第三层:智能决策与编排层

核心关键词: Planner 任务拆解, DAG, Tool Registry 注册与调度, ReAct, Plan-Execute, Multi-Agent, Function Calling, RAG, JSON Schema

  • 说明:这是整个平台最核心的智能层(大脑)。大模型(LLM)在这里扮演管理者:
    • Planner(计划者) 拿到一个简单需求(如“制作一个30秒科技感宣传片”),利用 Function CallingRAG(检索历史经验/规范),拆解成复杂的 DAG(依赖图),并输出标准的 JSON Schema
    • Tool Registry(工具库) 将所有底层API包装成可调用的工具,供大脑随时取用。
    • ReAct / Plan-Execute 是大脑思考的两种基本范式。多Agent协作时(Multi-Agent),可能会有“分镜导演Agent”、“配音Agent”、“剪辑Agent”相互沟通。

第四层:反馈与优化层

核心关键词: Critic 反思回退闭环, PTC 模式, 批量任务执行, Token成本, 端到端时延, 人工审批

  • 说明:工厂生产完不能直接交付,需要质检。
    • Critic(评论家) 会对生成结果进行自动打分。如果视频不达标,会触发 反思回退,将任务重新扔回第三层(大脑),要求重新编排或重试,直到达标或触发 人工审批
    • PTC(程序化工具调用)批量任务 则是为了提高效率。通过程序化(非LLM推理)的方式去调用确定的工具,减少大模型反复思考带来的 Token成本时延,实现高效批量化生产。

💡 核心链路全景图

输入端:用户输入一句指令(例如:生成一段赛博朋克风的特效视频)

【第三层:智能决策层】

Planner 拆解任务(生成脚本 -> 生成分镜 -> 生成图片 -> 生成视频 -> 配音 -> 合成) => 构建 DAG。利用 RAG 匹配最佳参数,通过 JSON Schema 下达指令。

【第二层:执行与状态层】

Harness 插件系统接收指令,通过 Temporal/Argo 启动工作流。系统开启 权限闸门审计日志。任务支持 断点续跑

【第一层:基础设施层】 按DAG顺序,通过 Tool Registry 调度 ComfyUI/可灵 等底层工具,逐一生成图片、视频、配音,并注意 算力成本

【第四层:反馈与优化层】 生成完毕后,Critic 进行自动评估(画质、时长、对齐度)。

  • 如果不达标:触发反思回退闭环,跳回第三层重新调整Prompt或参数。
  • 如果超标:触发 人工审批,或者通过 PTC 模式进行批量微调。整个过程中不断优化 Token消耗时延

输出端:高质量视频交付。