背景

漫剧(动态漫画/AI短剧)在2025-2026年经历了从"单点工具拼接"到"工业化流水线"的转变。早期做一部AI短片,靠的是 ChatGPT 写故事、Midjourney 出图、再找个剪辑软件手工拼接(参考早年写的《ChatGPT + Midjourney + Clipcha制作出一部视频》,那会儿全靠人工在多个工具间倒腾素材)。

现在的思路完全变了:把"编剧、导演、摄像、美术、配音"这几个传统影视工种,全部拆解成 AI Agent 或 AI 工具节点,用流水线的方式串起来,实现从一段文字(小说/剧本大纲)到成片的全自动生产。这篇整理一下目前几个关键技术组件(ChatGPT、LibTV、Seedance 2.0、OiiOii/openOii)各自在流水线里扮演的角色,以及怎么把它们串成一套可复用的工业化流程。

全流程的角色拆解

传统影视制作的工业流程可以拆成这几个环节,AI化之后对应关系大致是:

传统角色 对应工作内容 AI化承担方式
编剧 剧本、台词、分场大纲 LLM(ChatGPT等)生成剧本结构和对白
导演/分镜师 分镜脚本、镜头语言、运镜设计 LLM + 分镜Skill(LibTV Skill Hub)生成分镜提示词
美术/造型 角色设计、场景美术、道具 文生图模型 + 角色三视图Skill,保证跨镜头人设统一
摄像/特效 镜头运动、战斗场景、转场 视频生成模型(Seedance 2.0等)直接生成带运镜的分镜视频
配音演员 台词配音、音效、BGM 多模态视频模型的原生音频联合生成,或独立TTS
剪辑/后期 素材拼接、调色、成片输出 自动化流水线工具(LibTV、openOii等)按分镜顺序拼接导出

关键变化在于:以前每个环节都是独立工具+人工衔接,现在分镜脚本本身就是流水线里的"中间数据格式"——编剧和导演产出的不是给人看的文档,而是给下游生成模型直接消费的结构化提示词(角色描述、镜头描述、时长、对白文本)。

核心工具栈

ChatGPT:剧本与分镜脚本生成

在流水线最上游,ChatGPT(或同类LLM)负责把"一句话创意"或"小说原文"转成结构化的生产资料:

  1. 剧本大纲:分场、分幕,角色关系梳理
  2. 分镜脚本:把每一场戏拆成具体镜头,每个镜头写清楚"画面内容 + 运镜方式 + 台词/旁白 + 预估时长"
  3. 角色设定表:外观描述、性格、语言风格,作为后续文生图和配音的输入约束

这一步的输出质量直接决定后面能不能自动化——如果分镜脚本写得不够结构化(比如镜头描述太模糊、角色描述前后不一致),下游生成环节就会出现"人设跑偏"的问题。行业实践中常见的做法是让 LLM 按固定模板输出 JSON/YAML 格式的分镜数据,而不是自然语言段落,这样才能被后续工具程序化解析。

LibTV:导演级Skill与全流程平台

LibTV 是 LiblibAI 推出的专业 AI 视频创作平台,定位是"管理从概念到成片的整个内容生产过程",而不是单一的生成模型。它比较关键的能力是 Skill Hub——上线了 100+ 个"导演级 Skill",可以让 Agent 通过一句话调用整套拍片流程:

  • 角色三视图:给定角色描述,生成正面/侧面/背面三视图,作为后续每个镜头生成时的形象参考图,这是解决"多镜头人设不统一"问题的关键手段之一
  • 分镜设计:AI 电影分镜生成 Skill 能"以导演级视听思维串联全流程,输出可直接投喂 Midjourney / Seedance / 即梦等 AI 工具的分镜提示词"
  • 首尾帧视频:给定一段镜头的起始帧和结束帧图片,生成中间的运动过程,这个功能对"战斗场景"之类需要精确控制运动轨迹的镜头特别实用
  • 视频续写、风格迁移、局部编辑:用于成片阶段的精修

LibTV 的架构思路是把这些能力封装成标准化的 Skill 接口,供 Agent 编排调用——这跟后面要讲的"多Agent协作"思路是一致的,LibTV 更像是提供了一套"导演的工具箱",Agent 负责决定什么时候调用哪个工具。

Seedance 2.0:多模态联合生成的视频引擎

Seedance 2.0 是字节跳动 Seed 团队推出的新一代统一多模态视频生成模型,核心突破是 Dual-branch DiT(Diffusion Transformer)架构,能够联合生成画面、对白、口型同步和音效——这意味着一个镜头的"画面+声音"可以在同一次生成里一次性产出,不需要视频和音频分别生成再对齐。

它的几个特点对漫剧生产流水线特别重要:

  1. 四模态输入:文本、图像、音频、视频,最多支持 12 个混合输入文件同时作为约束条件。这让"用角色三视图 + 台词文本 + 参考镜头"一起驱动生成成为可能,比单纯的文生视频可控性强得多
  2. 原生同步音频:对白、音效、环境音、音乐在一次生成里完成,不需要额外的口型同步(lip-sync)后处理步骤
  3. R2V(Reference-to-Video)统一端点:Reference、Edit、Extend、Stitch 四种工作流共享同一套提示词路由——也就是说"参考已有素材生成新镜头"“编辑已有镜头"“续写镜头"“拼接镜头"这几个在传统流程里需要不同工具的操作,在 Seedance 这里是同一个接口,靠提示词的表达方式来区分意图

对漫剧生产来说,Seedance 2.0 这一层基本承担了"摄像+配音演员+音效师"的角色——上游给出分镜描述和角色参考图,这一层直接产出带声音的成片镜头。

OiiOii / openOii:多Agent协作的开源方案

如果说 LibTV 和 Seedance 是"工具”,那 openOii(开源社区对标 OiiOii 的实现,GitHub: Xeron2000/openOii)代表的是流程编排这一层——用多个专职 Agent 协作,模拟真实剧组的分工:“故事想法 → 多智能体协作 → 漫剧成片”。

这类多Agent架构的典型分工模式(参考 openOii 及同类项目如 alibaba/lumenxmurongg/openframe):

  • 编剧 Agent:负责剧本分析和场次拆解
  • 美术 Agent:负责角色/场景的视觉设定,产出可复用的角色参考图
  • 分镜 Agent:把剧本转成具体的镜头列表和提示词
  • 生成调度 Agent:调用底层生成模型(LibTV Skill 或 Seedance API)产出素材
  • 合成/剪辑 Agent:按镜头顺序拼接素材,导出最终成片(有的项目支持导出 FCPXML/EDL,可以再导入专业剪辑软件精修)

这套架构的价值在于把"导演"这个统筹性角色也变成了可编排的流程,而不只是把单个生成环节自动化。类似的框架思路可以参考 crewAI 这种通用的多Agent协作框架——本质上漫剧生产流水线就是一个垂直领域的 Agent Crew。

一套可落地的工业化流水线设计

把上面几个组件串起来,一个典型的漫剧自动化生产流水线大致是这样:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
输入:小说文本 / 一句话创意
[编剧Agent / ChatGPT]
   剧本大纲 → 分场 → 结构化分镜脚本(JSON:镜头描述/时长/台词/运镜)
   角色设定表(外观/性格/语言风格)
[美术环节 / LibTV角色三视图Skill]
   为每个角色生成正侧背三视图,作为形象基准
   为关键场景生成场景参考图
[分镜Agent / LibTV分镜设计Skill]
   逐镜头生成可直接投喂生成模型的提示词
   战斗场景等复杂镜头:用首尾帧Skill锁定关键姿态,控制运动轨迹
[生成调度Agent / Seedance 2.0]
   输入:镜头提示词 + 角色参考图 + 台词文本(多模态混合输入)
   输出:带原生音频(对白/音效/口型同步)的成片镜头
[合成Agent / openOii类工具]
   按分镜顺序拼接镜头,配BGM,输出成片或导出EDL供精修

几个需要重点处理的工程细节:

人设一致性:这是多镜头漫剧生产里最容易出问题的环节。解决思路不是靠"写更详细的文字描述”,而是靠图像级的参考约束——角色三视图一旦生成,后续每个镜头生成时都把它作为输入图像传给 Seedance,而不是每次重新用文字描述"生成"角色。这跟前面提到的"全流程制作平台"和"视频生成模型"两类工具的分工逻辑也对应得上:全流程平台负责维护和分发这些视觉基准素材,视频生成模型负责在给定基准下生成新镜头。

分镜脚本的结构化程度:编剧 Agent 的输出必须是可被程序解析的结构化数据(而不是一段文字描述),字段至少要包含镜头编号、画面描述、运镜方式、时长、台词、情绪/氛围标签。这是流水线能不能自动跑通的地基,也是目前很多"AI一句话拍片"体验翻车的根本原因——上游给的指令不够结构化,下游生成模型再强也补不回来。

分工的粒度:不建议把"编剧+分镜+美术"全塞给一个 Agent 一次性输出,容易在长篇幅生成中丢失一致性。按环节拆成独立 Agent、用共享的结构化中间数据(角色设定JSON、分镜列表JSON)传递上下文,是目前多Agent漫剧项目(openOii、lumenx、openframe)的共同做法。

输出格式的可编辑性:成片阶段建议保留导出 EDL/FCPXML 的能力,而不是只出一个不可再编辑的 MP4——工业化流水线的价值是省掉重复性劳动,但关键镜头的人工精修环节还是要留出接口,不然遇到生成效果不理想的镜头只能推倒重来。

成本结构:技术只是流水线的一部分

工业化流水线跑通了,能不能挣钱是另一个问题。做AI漫剧的实际成本至少要拆成四块:剧本版权、账号、AI API、以及投流/分发——技术流水线只解决了"生产"这一环,后面三项往往比生成成本更重、更容易被低估。

剧本版权成本

短剧的剧本来源大致三种,成本差异很大:

  • 原创剧本:成本最低,但对编剧能力要求高,AI流水线里的"编剧Agent"目前主要还是辅助生成初稿和结构化分镜,专业短剧的强反转、强节奏感仍然依赖人工把关,纯AI原创剧本目前上线过审的成功率不高
  • 网文/小说改编:需要向原作者或版权方购买影视改编授权。这块市场目前没有统一定价,头部IP授权费可以到数万到数十万元不等,中小体量的网文改编费用相对低,但要注意授权范围(是否包含短剧/漫剧形式、是否独家、地域范围)要在合同里写清楚,避免后续维权纠纷
  • AI辅助改编已有公开IP:需要格外谨慎——用AI"魔改"知名IP(哪吒等文化符号类改编近期就有争议案例)容易踩侵权红线,尤其是涉及角色形象、世界观设定的改编,版权边界不像文字作品那么清晰,建议做之前先做法务确认

一个容易被忽略的隐性成本:AI生成的分镜脚本和图像本身的版权归属目前在国内法律实践里还不算完全清晰(AI生成内容的可版权性存在争议),如果剧本改编自第三方IP,理论上还要看平台/分发渠道对"AI生成内容+已有IP"这种组合的审核政策,部分平台会额外要求提供改编授权证明。

账号成本

短剧的分发严重依赖平台账号(抖音、快手、红果、各类短剧小程序/App)体系,账号本身是一项持续性成本,而不是一次性投入:

  • 企业资质与备案:正规运营短剧内容需要ICP备案、《网络文化经营许可证》(文网文)、部分情况下还需要广播电视节目制作经营许可证,这几张证件的代办/自办成本,以及维持资质的年度合规成本,是容易被新手忽略的一块
  • 平台账号权重:新账号从零起步,冷启动阶段的自然流量非常有限,行业里普遍做法是"多账号矩阵"分发同一部作品的不同剪辑版本,这意味着账号数量本身要按量走,而不是一个账号打天下——每个账号还有对应的内容审核、违规封号风险,需要预留账号池的持续投入
  • 不要买卖账号:市面上大量"抖音账号出售/批发"服务游走在平台规则边缘,用非自然注册的账号做商业分发,一旦被平台识别会导致限流甚至封号,前期投入直接打水漂,这不是可持续的成本项,只是把风险后置了

AI API成本(生成环节的直接开支)

这是流水线里最容易量化的一块。以 Seedance 2.0 为例(2026年公开价格,不同第三方转发平台价格有差异):

  • 文生视频:Standard 档约 $0.092/秒(480p)到 $0.199/秒(720p),Fast 档更便宜一些
  • 第三方平台的 1080p 转发价格,实测大约在 $1.2/条左右(具体取决于时长和分辨率)
  • Seedance 2.5 一条30秒的片段,480p约 $3左右,720p约 $7左右,4K分辨率的长片段成本会显著上升(30秒4K可能到 $15+)

按这个价格粗算,一部几十集、每集1-3分钟的竖屏短剧(这是目前分账短剧的主流形态),如果大量镜头都用AI视频生成,仅视频生成这一项的API开支,就可能达到大几千到上万元人民币的量级(具体取决于分辨率选择、镜头数量、返工率)。返工率是最大的不可控变量——人设跑偏、动作穿模、镜头逻辑不连贯导致的重新生成,实际消耗往往是"理论最少生成次数"的数倍。

除了视频生成,还要算上:

  • LLM调用成本(ChatGPT等,用于剧本生成、分镜脚本结构化,通常远低于视频生成部分)
  • LibTV等平台的会员/Skill调用费用(按平台自身的订阅或按次计费规则)
  • 配音/TTS的独立成本(如果不用视频模型自带的原生音频,单独走TTS服务)

短剧盈利模式

生成出来的成片要能变现,目前行业内的模式主要是这几类:

  1. IAA(广告变现):以"红果短剧"为代表——全部内容免费观看,靠中插/贴片广告变现,用户规模是核心,适合走量、靠矩阵账号铺量博概率
  2. IAP(付费解锁):经典的"分账短剧"模式——前几集免费吸引,后续集数付费解锁(一般在小程序/App里按集或按会员付费),这是目前国内短剧最主流的商业模式,前期需要通过投流(信息流广告)把用户导流到付费入口,投流成本本身也是一大开支,且和内容质量的相关性很强——留存差的内容投流ROI会很难打正
  3. IAA+IAP混合:免费用户看广告,愿意付费的用户解锁免广告/超前点播,两条腿走路降低对单一变现方式的依赖,是2026年出海短剧(TikTok等)比较主流的做法
  4. 平台分账:不少内容方不直接面向用户收费,而是把成片提供给短剧分发平台,按平台的"有效观看"或点击等指标进行内容分账,这种模式对内容方来说现金流更稳定,但话语权和分账比例取决于和平台的谈判能力

投流成本往往比内容制作成本本身更大——短剧行业公开的经验是,投流费用常常占到总成本的大头,内容制作(不管是传统实拍还是AI生成)反而只是"入场门票”。也就是说,即便AI流水线把生产成本压得很低,如果没有配套的投流预算和渠道能力,内容做出来也很难触达到能覆盖成本的用户量。这也是为什么这轮AI漫剧热潮里,真正能规模化盈利的团队,往往不是纯技术团队,而是同时具备内容生产能力和投流/发行经验的团队。

小结

目前AI漫剧的工业化,本质上是把"剧本→分镜→美术→摄像→配音→剪辑"这条传统流水线,映射成了"LLM生成结构化数据→多模态生成模型消费结构化数据"的技术流水线。ChatGPT 负责最上游的叙事结构,LibTV 提供导演级的分镜/角色标准化工具箱,Seedance 2.0 承担画面+声音的联合生成引擎,openOii 这类多Agent框架负责把整条链路的调度和分工组织起来。

真正决定产出质量的不是单个模型强不强,而是中间数据格式设计得好不好——角色形象能不能被稳定复用、分镜脚本够不够结构化,这些工程细节比选哪个生成模型更重要。


参考资料


相关阅读