AI COMIC DRAMA PLAYBOOK · 2026

把一个故事,做成能追更的漫剧

从剧本拆解、角色一致性、分镜图到动态镜头、配音和发布,一页掌握完整生产链。重点不是“会生成”,而是稳定、批量地做出下一集。

资料更新:2026 年 9 月 · 价格和版本变化快,投产前请以官方页面为准
01 · PRODUCTION PIPELINE

完整制作流程

每一步都要留下可复用的“资产”,而不是只留最终视频。角色图、场景图、镜头表、声音和提示词库共同决定下一集能不能稳定复刻。

01 / 定位

受众与商业目标

先定平台、画幅、单集时长和更新频率。再选题材:逆袭、悬疑、情感、修仙或知识剧情。

交付:项目简报 + 对标清单
02 / 编剧

故事与分集剧本

按“冷开场—冲突升级—小兑现—强钩子”组织。台词短、动作可视化,避免旁白代替剧情。

交付:分集梗概 + 场次台本
03 / 美术

角色与场景圣经

锁定脸型、发型、服装、色板、年龄和禁改项;为高频场景建立日/夜/雨等状态。

交付:角色卡 + 场景卡
04 / 导演

分镜与节拍

先用静态分镜解决叙事,再做动态。每镜只表达一个动作或情绪,标注景别、机位和时长。

交付:镜头表 + Animatic
05 / 出图

关键帧生产

以角色参考图、风格参考图和场景锚点生成首尾帧。优先修脸、手、道具和空间关系。

交付:镜头首帧 / 尾帧
06 / 视频

图生视频与表演

从低成本预演到高质量重算。用动作、速度、镜头运动和“不发生什么”控制单镜。

交付:无声镜头素材
07 / 声音

配音、音乐与音效

角色建立固定音色、语速和情绪范围。对白先行剪辑,再铺环境声、动作声和音乐。

交付:分轨音频 + 字幕
08 / 交付

剪辑、质检与发布

检查连续性、口型、字幕安全区与响度。首 3 秒给冲突,结尾留可被一句话复述的悬念。

交付:母版 + 数据复盘表
02 · MODEL & PLATFORM MATRIX

模型怎么选

按漫剧生产真正关心的维度比较:角色一致性、动态质量、镜头控制、原生声音、中文易用性与自动化能力。星级为编辑性建议,不是统一实验室排名。

模型 / 平台类型最适合一致性动态 / 控制声音使用建议
可灵 3.0 / Omni视频国内动作、中文叙事、多镜头★★★★★高 / 高原生音频综合型主力;主体与音色管理适合系列化。
Google Veo 3.1 / Flow视频海外电影感、物理、音画一体★★★★★高 / 很高原生音频支持参考、首尾帧、扩展、对象编辑与 4K。
Runway Gen-4.5视频海外可控创作、编辑、商业片★★★★☆高 / 很高支持工具链成熟;适合镜头迭代、编辑和团队协作。
即梦 / Seedance视频国内中文创作、漫剧、快速迭代★★★★☆高 / 中高视版本门槛低、中文生态顺,适合个人与小团队。
海螺 Hailuo 2.3视频国内人物动作、风格表现、批量★★★★☆高 / 中配套语音Fast 适合批量预演,标准模型用于保留镜头。
Luma Ray / Dream Machine视频快速探索、修改现有视频★★★★☆高 / 高配套适合气氛镜头、首尾帧与视频修改。
Pika视频创意特效、社媒片段★★★☆☆中 / 中配套上手快;不建议独自承担长篇连续叙事。
Midjourney V7图像概念美术、风格探索★★★★☆— / 中审美强;先做角色和场景风格板。
FLUX Kontext / FLUX.2图像API参考图编辑、自动化、本地生态★★★★★— / 很高适合批量角色换景、局部修改与节点化生产。
Ideogram 3.0图像文字、海报、封面★★★☆☆— / 高标题文字突出;角色连续性需额外方案。
Gemini Image图像多模态指令编辑、多图参考★★★★★— / 很高适合连续改图与资产清理。
ComfyUI工作流开源私有化、批量、精细控制取决于模型很高可接入学习成本高,但可复现、可排队、可组合。

能力会随版本与地区变化。商业价格不写死,以避免快速过期;投产前请查官方页面。

个人试水

即梦/可灵完成图与视频,剪映做后期。先验证题材。

小团队周更

两家视频主力 + 一家备选,统一剪辑模板和音色库。

高质量短片

Veo / Runway / 可灵承担核心镜头;先做 Animatic。

批量工业化

ComfyUI + API + 资产库,记录模型、种子与版本。

03 · COST & QUALITY

先算废片率,再算单价

最贵的不是一次生成,而是模糊的分镜导致反复抽卡。把成本拆到镜头级,才能知道该在哪些镜头升级模型。

一集的成本结构

35–50%视频生成与重算
15–25%角色、场景与关键帧
10–20%配音、音乐与音效
20–30%编剧、分镜、剪辑与质检
真实单镜成本 = 单次生成价 × 平均尝试次数 + 人工修复时间
单集成本 = Σ镜头成本 + 固定资产摊销

上线前 8 项质检

01
角色脸、发型、服装是否连续检查正反打、远近景和侧脸
02
空间方向与道具位置是否跳变门、窗、武器和手持物最容易穿帮
03
动作是否有起承落避免漂移、瞬移、多余肢体与无意义运镜
04
对白、口型、情绪与字幕一致字幕不遮脸,专名保持统一
05–08
响度、节奏、钩子、导出规格手机外放复听;首 3 秒和结尾单独检查
04 · REUSABLE TEMPLATES

可直接复用的模板

好提示词不是堆形容词,而是把镜头中的不确定性变成字段。复制后替换方括号内容,并保留项目固定锚点。

角色设定图

角色:[姓名/年龄/身份]
固定特征:[脸型/发型/瞳色]
服装锚点:[材质/颜色/配饰]
画面:半身主视图 + 全身三视图
风格:[项目统一风格]
背景:纯色,无文字,无手持物
禁止:[不可变化项]

关键帧 / 分镜图

[景别],[机位],[角色]位于[构图位置],正在[单一动作];表情[情绪];[场景锚点];[时段与主光];前景[元素],背景[元素];[画幅];保持角色服装与参考图一致。

图生视频镜头

主体动作:[起点→过程→终点]
镜头:[固定/推/拉/摇/移/跟]
速度:[缓慢/正常/快速]
环境运动:[风/雨/布料/粒子]
表演:[视线/呼吸/微表情]
保持:脸、服装、背景结构
避免:变形、漂移、额外人物、镜头乱晃
05 · PITFALLS & RIGHTS

六个高频翻车点

技术能生成,不等于内容能商用。把授权、素材来源和平台规则纳入制作表,比成片后补救便宜得多。

角色越做越不像

冻结角色圣经;只保留一套“母参考”,不要从生成结果无限套娃。

镜头漂亮但讲不清

先看无声 Animatic。静态分镜讲不清,视频模型也补不上叙事逻辑。

全片只有一种运镜

按剧情功能选镜头:信息用固定,压迫用推进,揭示用横移或拉远。

成本失控

预演用快速模型,入选后再高质量重算;为单镜设置最大尝试次数。

声音像拼贴

建立音色卡;环境声贯穿场景,避免每次切镜声音归零。

版权与肖像风险

记录条款、素材来源与授权范围;避免未经许可复刻真人、商标角色和音乐。