探索记录 · 制作流程 · 行动规划

AI视频短剧探索规划

更新日期
已完成已讨论待验证后续探索

当前阶段:已完成流程与模型价格调研、一个虚构老板角色的二维资产包、六镜文字分镜示例。尚未生成真实视频或声音,尚未完成端到端样片或云手机自动化验证。下一步先做 6–8 秒单镜头,再做 30–60 秒完整故事,最后评估 10 分钟制作。

状态基准:2026-09-16。本文合并三个会话,并以当前文件核对实际交付。标注“已完成”仅指该行描述的产物;调研完成不等于效果实测完成。后续行动是建议顺序,尚未排定负责人、日期或批准付费实验预算。

一、目标与阶段判断

目标:验证固定虚拟演员能否稳定出演生活类短剧,并逐步形成可复用的角色、场景、分镜、声音和剪辑模板。样例故事采用“卤味店生意好 → 房东涨租 → 协商失败 → 老板搬到附近 → 房东跟开店 → 熟客回流 → 房东经营失败”。

当前路线以二维人物参考图与图生视频为主。角色编号用于资产管理;真正保持身份需要按模型要求上传参考图或绑定主体。当前没有三维网格、骨骼、材质等资产,也没有训练专属 LoRA。

状态

含义

目前对应内容

已完成

有可检查的文件或已交付的文字结论

流程说明、模型成本表、老陈 6 张图片与角色包、6 镜文字示例

已讨论,待验证

已提出方案;尚无实验结果或运行回执

视频角色一致性、中文对白与口型、模型效果优劣、云手机价值

后续探索

需要新执行的制作、比较或工程任务

视频试拍、补房东/熟客、样片剪辑、10 分钟预算实测、App 自动化

二、已完成成果与证据

编号

已完成内容

证据与边界

D01

制作链路与复用方法梳理

已解释剧本 → 角色库 → 文字分镜 → 分镜图 → 视频/声音 → 剪辑;人物复用与旧镜头复用需分别判断。没有具体账号的制作来源证据。

D02

主流模型与 10 分钟费用资料对比

已整理图像、视频和语音模型,统一按 600/1,800 秒测算。完成的是官方资料核查,不是横向效果实测。详见附录。

D03

老板“老陈”二维角色库 v1

BOSS_CHEN_001,42 岁虚构中国男性;6 张 PNG、角色说明、实际图像提示词、预览 HTML 与 ZIP 已落地。

D04

单镜头试拍提示词

约 7 秒点头微笑无台词、约 7 秒一句话开口两套文字提示词。未实际生成对应视频或声音。

D05

30 秒文字分镜示例

6 镜 × 5 秒,已有景别、动作及声音设计思路。未生成这 6 镜的图片、视频或合成片。

D06

素材交付检查

角色预览、图片文件、资源链接及 ZIP 完整性有检查记录;本次复核 6 张 PNG 有效、ZIP 无损坏。动态效果仍待验证。

三、角色库与分镜现状

3.1 已有角色:老陈

固定特征:42 岁中国男性,略宽方脸、黑色侧分短发、两鬓少量灰白、无胡须眼镜,中等略壮身材。性格爽快细心,听人说话轻微点头。声音仅有“普通话、温和中低音、不紧不慢”的文字设定。

资产

用途

状态

01-master.png

正面主参考,身份基准

已完成

02-angle-45.png / 03-profile.png

45° 与 90°侧面半身参考

已完成;尚未验证视频转头连续性

04-scene.png

便利店单人中景首帧

已完成;不是卤味店场景

05-outfit-casual.png / 06-outfit-winter.png

W02 灰绿夹克、W03 深棕开衫两套便装

已完成;一场戏保持一套服装

README / prompts.json / 制作记录 / HTML / ZIP

角色规则、提示词、使用说明与可下载材料

已完成;图像实际使用内置 image_gen,未指定底层模型版本

房东、熟客

对手角色与顾客角色

后续探索:尚未建库

声音、主体绑定、动态视频

稳定音色与可复用的视频角色

后续探索:没有文件或绑定结果

完整角色库、六张独立图片及可复制试拍提示词通过以下网页访问;下载包保留现有素材原貌。

查看老陈角色库与试拍提示词

下载老陈角色库 ZIP

3.2 已有 30 秒文字分镜(整理版)

镜头 / 时长

主要画面与动作

制作目的

01 / 5 秒

卤味店门口,顾客排队

交代生意好与环境

02 / 5 秒

老板切肉

建立主人公与手艺

03 / 5 秒

房东递涨租通知

引入冲突

04 / 5 秒

老板摇头

表达不接受

05 / 5 秒

老板收起食品夹

表现决定收摊

06 / 5 秒

拉下卷帘门

结束这一段落

衔接缺口:现有图片是便利店,文字分镜是卤味店;现有 30 秒示例只到关店,尚未覆盖搬店、房东自营、熟客回流与结局。进入样片制作前,需要统一场景并补齐完整故事。

四、后续探索与验收条件

按下表顺序推进。每项通过后再扩大规模,优先得到可回看的样片与真实账单。表内验收条件是本次规划建议,不代表已完成或已承诺效果。

任务 / 优先级

下一步动作

交付与验收

E01 / P0:统一素材与剧本

保留现有便利店角色包作基线;为卤味店另建首帧和场景版本;补齐原故事后半段

完整故事梗概、角色/场景对应表;不把便利店首帧误标成卤味店

E02 / P0:首个 6–8 秒镜头

复用老陈,固定机位、单人、小动作、无台词;先验证人物动起来

可播放视频 + 输入图/提示词/模型/参数/费用;检查首中尾帧的脸、发际线、衣服和手部

E03 / P0:声音与开口

选定一版音色,以一句短台词测试原生音画或配音加对口型

声音与视频文件;复听文字准确性、音色、情绪,检查口型;记录是否成功绑定声音

E04 / P1:补角色与多人镜头

建立房东、熟客角色卡和独立参考图;先试双人同框,再试交替说话

两份角色包与双人短片;不串脸、不交换服装、说话人正确

E05 / P1:30–60 秒闭环样片

按完整冲突与结局拆镜,生成首帧/视频,完成声音、字幕和剪辑

一条有开端、冲突和结局的可播放样片;角色、服装、场景与声音连续

E06 / P1:模型同题比较

选择 2–3 个候选模型,用相同参考图测试单人、双人、店内多人三类镜头

保留全部尝试与账单,比较可用率、每可用秒费用、等待与人工修正时间;据结果选主力和备选

E07 / P2:10 分钟试制

复用通过审核的角色、场景与剪辑模板,记录整片重做和人工工时

10 分钟成片与实际全成本表;再决定批量生产是否值得

E08 / P1:云手机小试验

选一个必须通过 App 完成的环节,先做上传素材 → 填标题封面 → 保存草稿

建议连续 3 次运行成功且无重复上传;记录耗时、Agent 调用、人工接管、异常恢复与租赁成本

E09 / P2:批量编排

在样片及 App 试验通过后,增加任务状态、素材版本、失败重试与记录

同一输入可追溯到模型任务和成片;重试不重复付费提交或重复发布;建立人工接管入口

可后置探索:角色 LoRA、三维演员、复杂长镜头、全自动剪辑与批量分发。当前二维参考图路线尚未完成动态验证,先依据样片的实际瓶颈决定是否引入这些方案。

五、模型分工与预算原则

步骤

候选工具类别

选型判断

剧本与文字分镜

GPT / Claude / Gemini / DeepSeek / Qwen / 豆包 / Kimi 等

剧情可理解、动作可拍、台词适配时长、结构化输出稳定

角色和分镜图片

Seedream / GPT Image / Nano Banana / FLUX / Midjourney / Firefly

多参考图能力、同一角色换角度/服装/场景的成功率

图生视频

Seedance / Vidu / MiniMax / Wan / 可灵 / Veo / Runway / Luma / Pika / PixVerse 等

先检查人物和动作可用性,再比较每可用秒费用

声音

原生音画或 MiniMax Speech / ElevenLabs / 豆包语音

中文台词、角色音色、情绪、口型及跨镜头声音一致性

剪辑

剪映/CapCut、Premiere、DaVinci Resolve;模板可用 FFmpeg

节奏和声画连续性优先;剪辑工具与模型分开记录

统一比较假设:10 分钟为 600 秒;按生成 1,800 秒、采用 600 秒预留预算。“3 倍生成量”是测算假设,没有实测证明各模型通过率相同。人民币与美元分开,不混 API 消耗与网页会员额度。

完整成本 = 视频生成 + 人物/分镜图 + 配音/口型 + 剪辑工具 + 人工 + 云手机/Agent/存储。有效生成成本 = 所有计费尝试总费用 ÷ 最终采用的视频秒数。

示例:Vidu Q3 Turbo 视频生成费 ¥675 + 其他素材/工具假设 ¥100 + 人工假设 20 小时 × ¥80 = ¥2,375,再加实际云手机费用。这是预算演算,尚无本项目的真实成片账单,也不是市场报价。

六、云手机:优势、痛点、竞争方案与验证

推荐分工:主控程序管理剧本、任务和素材;模型 API 生成图片、视频及配音;电脑或服务端剪辑;云手机承接必须通过移动 App 完成的操作、预览和交付。云手机主要节省操作工时,模型推理费用仍要支付。

候选角色

可执行动作

当前状态 / 下一步

无 API 的创作入口

传参考图、填提示词、查询进度、取结果

已讨论,待验证目标 App 兼容性及后台任务恢复

素材交接与移动模板

上传素材、套字幕/封面模板、导出

已讨论,待测文件格式、导出限制与操作工时

移动端检查

检查竖屏裁切、字幕遮挡、封面、播放

已讨论,需建立检查清单并留人工复核

发布准备

上传成片、填标题、选封面、存草稿

建议作为首个小试验;正式发布按用户授权执行

账号环境与数据回收

保留获授权账号环境,读取自己的创作者数据

已讨论,待验证登录、接口可用性与获取范围

净节省 = 减少的人工时间 × 人工时薪 − 云手机租赁 − 带宽/存储 − GUI Agent 调用 − 异常处理成本。按账号环境和操作并发分配实例,不需要每个模型一台手机。

云手机官方 API:应用、文件、截图与 Agent 任务能力

6.1 是否有优势:先明确比较对象

结论:云手机对 AI 视频的优势主要在“移动 App 执行与交付”。视频生成、人物一致性和复杂剪辑并不会因换到云手机自然改善。有稳定官方 API 的步骤,优先比较 API 编排;有完整网页/桌面功能的步骤,优先比较网页/桌面;只有移动端功能必须保留、重复操作量足够大、异常接管可控时,云手机才更可能划算。以下优势和优先级是分析判断,尚未经本项目实测。

基础云手机提供远程 Android 环境;自动点选、任务编排与素材交接还需要 GUI Agent、RPA 或素材服务。下文涉及节省重复操作的收益,均指云手机与这些能力组合后的方案;单独租用云手机不会自动完成制作流程。

比较对象

云手机可能提供的优势

优势成立的条件

人工操作多台实体手机

远程分配工作位,集中保留 App 状态,减少设备采购、充电与交接;自动化另可减少重复操作

需要多个长期移动环境;实例利用率足够高、兼容目标 App,并配套可用的自动化

模型 API 编排

覆盖未开放 API 的移动专属模板、编辑功能或交付步骤

该能力确实无法用已有 API 等效完成;生成价格差额单独核算

桌面/网页自动化

保留目标 Android App 的原生操作入口和草稿环境

网页端缺关键能力,或同任务的手机流程实测更省工时

普通云手机租赁

若叠加行业模板、素材交接、任务回执、失败恢复与人工接管,可交付更完整的业务结果

这些能力要实际实现并在目标 App 上验证;仅提供 Android 实例不是新增差异化

6.2 用户痛点:哪些能解决,哪些仍在

痛点

云手机作用

仍需解决的问题

人物变脸、串脸、服装漂移

直接作用低;只能代为调用生成和重做功能

角色参考、主体绑定、模型选择、镜头约束和质量审核

剧情不连贯、对白口型不准、镜头不可用

直接作用低;不会提升所调用模型的能力

剧本/分镜、配音/口型工具、剪辑及重做;记录每可用秒成本

生成太贵或服务端排队久

通常无直接优势;手机并发不等于模型吞吐增加

模型费、入口套餐、配额、可用率;避免手机或 Agent 为等待任务持续占用资源

没有 API 的 App 反复点选

有条件优势;GUI Agent 或固定流程可代办

页面改版、弹窗、加载时序、登录失效与非标准控件;需要异常恢复

跨 App 导入导出大视频

接入素材服务与自动化后可减少人工搬运,但可能增加传输与存储成本

统一素材库、格式与目录映射、去重、上传回执,核算文件传输耗时

多账号环境、多人交接与发布准备

相对手工真机有潜在管理优势

仅使用获授权账号;测登录保持、草稿状态与人工接管;正式发布依授权执行

少量作品、频繁临场改剧情或精细剪辑

优势弱;搭建与维护成本难摊薄

先用现有电脑/手机与创作工具完成样片,观察真正重复的工作

方案成本包括实例租赁、远程交互与文件传输、App 版本维护、登录处理和异常人工接管;采用 GUI Agent 时另有推理费,使用其他自动化也应核算其费用。一次“自动点完”只能证明通路存在,不能证明可靠、低成本或提高产能。云手机预览可检查版式与 App 展示,但不覆盖所有实体设备的色彩、音质、传感器及编码差异。

6.3 竞争方案:既有替代路径,也有直接竞品

方案 / 示例

主要优势

主要痛点 / 云手机需要证明什么

官方 API + n8n / 自建任务系统

参数明确,支持批量任务、状态回调、结果归档,等待不必占用手机界面

需要开发、配额与存储治理;若 API 能等效覆盖,云手机额外点击步骤通常缺少必要性

ComfyUI + 本地或云 GPU

可编辑节点流程、模型与生成参数;可通过服务端接口编排

需 GPU、显存及节点/模型版本维护;适合生成控制,不能替代手机独有交付环节

网页 / 桌面 + 自动化

即梦网页已有生成入口;适配桌面素材处理;有 DOM 时可用结构化定位

仍可能受界面变化影响;需逐项核对网页和手机是否功能相同

一体化创作平台:Runway Workflows、CapCut 桌面

内置生成、素材编辑与工作流,减少跨工具交接和搭建工作

模型、模板、会员权益和地区能力受产品限制;其已覆盖的流程不必再经云手机重做

实体手机 + 人工 / 自动化

直接验证目标 App 在实际设备上的表现;低量任务可立即起步

批量时有采购、充电、设备维护与交接成本;需比较有效总成本,而非只比租金

云手机 + GUI Agent / RPA

承接 Android App 的专属步骤,保持移动环境,远程执行和接管

需解决兼容性、界面漂移、失败恢复、重复提交与素材搬运;不保证天然优于其他路径

直接相邻竞品:GeeLark

官网已列出 AI 图像/视频、素材库、Android 云手机、RPA 与社媒发布模板

“AI + 云手机 + 自动化”已有产品;还要比较目标 App 覆盖、恢复能力、团队流程和单位任务成本

产品事实边界:GeeLark 官网主要展示 TikTok、Instagram、YouTube Shorts 等社媒流程,不据此推断它已适配国内抖音/快手,也不将厂商宣传视为稳定性实测。CapCut 的已核实能力不直接等同于国内剪映。网页存在不等于开放 API,各端模板、音色、模型、会员权益和导出能力需要逐项核对。

竞争判断:更值得验证的产品定位是“为某类视频团队交付可追溯、可恢复的移动 App 工作流程”。差异化候选包括国内目标 App 的稳定适配、素材与项目绑定、人工接管、版本维护和每条成功交付成本。单独提供云手机或通用点击 Agent,尚不足以证明优势。

6.4 如何判断划算:按成功交付核算

先比较同质量、同素材、同最终结果下的路径。云手机、网页与 API 的模型/会员价格可能不同,差额需要纳入;不能假设手机会员折算价等于 API 价,也不能默认走 App 更便宜。

月度净收益 = 成功交付量 ×(每次成功交付节省的人工分钟 ÷ 60 × 人工时薪 − 每次成功交付新增变量成本)− 相对基线新增固定成本。人工分钟包含所有失败与接管的摊销;变量成本按 Agent、模型、传输等账单分类各计一次,包含失败与重试消耗;新增固定成本包含实例租赁、开发与维护相对基线的差额或摊销。

如果每次成功交付的净节省小于或等于零,增加任务量通常无法靠规模扭转。若净节省为正,盈亏平衡成功交付量 = 新增固定成本 ÷ 每次成功交付净节省;还要验证并发扩张后是否需要增加实例与人工。

6.5 后续探索:把 E08 从“跑通”升级为对照验证

步骤

验证办法

决策输出

确认移动端必要性

选一个真实环节,列出 API、网页、桌面、手机功能差异,确认 App 独有价值

如果现有接口或桌面方案已满足目标,优先采用更简单的路径

少量通路试验

原 E08 的连续 3 次成功仅作为冒烟检查;先保存草稿,不以自动公开发布作为起点

得到失败类型、恢复方法与最小可执行流程

同题对照

建议再取 20–30 个代表任务做初步对比:人工/桌面、可用 API 或平台工作流、云手机;覆盖正常及异常路径

记录成功率、人工分钟、总耗时、模型费、设备/Agent费、传输、重试与重复提交

是否继续投入

以成功交付一次所需的全成本及可控性做判断;小样本仅支持初步判断

存在明确移动功能价值且净节省为正,再扩大试验;主要痛点在生成质量时,优先投入模型和素材制作

6.6 本次补充的一手来源

n8n:HTTP Request 节点支持 API、文件和批量请求

n8n:Wait 节点支持定时或 Webhook 恢复

ComfyUI:Wan 视频工作流

ComfyUI:队列、历史与任务接口

即梦:在线 AI 视频生成

CapCut:桌面 AI 编辑功能

Runway:Workflows 工作流说明

GeeLark:AI 创作、素材与云手机工作流

GeeLark:RPA、任务逻辑与异常处理

Vidu:对口型仍是独立生成能力

补充状态:优势、痛点与竞争方案调研已完成;目标 App 的功能差异、稳定性、节省工时和商业收益尚未实测。

七、实验记录与推进规则

记录类别

每次至少保留的字段

素材与输入

实验编号、角色/服装/场景版本、输入图、提示词、目标镜头和台词

模型与执行

服务与模型版本、入口/API、分辨率、时长、声音设置、任务 ID、开始/完成时间

质量与成本

采用/弃用及原因、每次扣费、总生成秒数、可用秒数、人工分钟数

声音检查

台词准确、说话人、音色、情绪、口型、跨镜头连续性

云手机试验

App 版本、步骤、成功/失败点、Agent 调用、人工接管、是否重复提交、恢复结果

初次制作前需选定候选模型入口、实验预算上限和目标画幅。当前示例可按竖屏、小动作镜头起步;具体执行时再确认这些参数。没有证据的能力继续标为待验证,有视频/账单/日志并完成检查后才更新为已完成。

八、来源与更新方式

原会话标题

本规划吸收的内容

分析AI短剧加工流程

全链路、人物复用、长片与分镜、模型费用、云手机分工

定人物为老板、房东、熟客选定形象,保存不同角度和常用服装的参考图可反复使用的角色库. ai视频中的人物具备哪些要素,另…

角色需求、老陈资产包、二维与三维澄清、试拍提示词

解释AI视频拆分镜操作

6 镜 × 5 秒示例、景别/动作/声音、单镜头体验方法

以上为应用返回的会话标题;角色会话标题在应用中已截断,以省略号保留。完成状态另用角色库 README、制作记录、PNG、提示词与 ZIP 核对。原始会话与本地素材不因本次整理而更改。

钉钉和网页由同一份规划正文生成,本次交付为 2026-09-16 快照;没有配置持续自动同步。后续在 E01–E09 行更新状态并附产物/费用,再同步两端,避免一处已完成、一处仍待验证。

附录:模型、效果与价格资料快照

以下沿用 2026-09-16 已核对的官方资料。效果简介是能力定位,不是本项目实测排名。优惠、版本与可用状态在实际采购前需复核;未核实的价格保留空缺。

2. 人物定妆与分镜图片

模型家族

适合环节与效果简介

需要留意

Seedream 5.0 Pro / Lite

中文场景、人物定妆、多图合成与局部修改;Pro 可用于多人同框、店铺招牌等较复杂图片

细小文字和精细一致性仍需检查;Pro、Lite 与产品入口开放能力有差异

GPT Image 2.5 Sunburst / Flare

定妆图、参考图编辑、人物换场景、局部修改;Sunburst 偏编辑精度,Flare 偏快速生成与日常编辑

连续镜头仍要检查脸、服装、道具;按 token 计费,不能用一个固定“每张价”覆盖所有设置

Nano Banana 2 / Pro

分别为 Gemini 3.1 Flash Image / Gemini 3 Pro Image;多参考图、自然语言编辑,适合角色分镜与反复修改

2 Lite 偏成本与速度,不以多参考图及连续多轮编辑为主要优化方向

Midjourney V8.2 + Edit Model

整体画风、人物视觉设计、场景质感;Edit Model 可用最多 4 张参考图组合与修改

多人特征可能混淆;旧版 V7 的 Omni Reference 教程不能直接套用到 V8.X。参见版本说明

FLUX.2 pro / max / flex / dev 等

真人质感、多图参考和人物/服装/场景组合;适合接入批处理流程

不同版本和入口的参考图数量、成本不同,详见多参考图限制

Adobe Firefly Image 5 / 4 Ultra

场景图、封面及后期修图;便于结合构图、风格参考及 Adobe 后期工具

风格相似不保证人物身份一致;Firefly 平台也承载外部模型

旧教程常见的 Imagen 4:Gemini API 的 standard/ultra/fast 端点已于 2026-08-17 关闭,该 API 新项目应按官方迁移建议选型。这一结论不代表所有第三方平台上的 Imagen 都已下线。官方生命周期说明

图像费用量级示例:Seedream 5.0 Pro 在不超过 261 万像素档为 ¥0.30/张,Lite 为 ¥0.22/张;Pro 第 2 张输入参考图起另收 ¥0.02/张。因此 100 张 Pro 输出的基础生成费约 ¥30,输入参考图与重做另算。火山官方价格

3. 图生视频及 10 分钟成本对比

统一口径:600 秒成片全部使用新生成画面;“生成 1,800 秒”是假设生成 3 倍素材、最终采用 600 秒。它只是预算比较假设,各模型实际可用率没有经过本表实测。

以下是 API 视频生成消耗,通常按 720p 或最接近档位;不含人物图、额外配音、剪辑、人工、云手机及其他订阅费用。人民币和美元分别列出;不用网页会员价代替 API 价。输入参考视频可能另计费。

模型/比较规格

效果与使用定位简述

声音口径

生成 600 秒

生成 1,800 秒

Seedance 2.0 Mini,720p,当前优惠

低价档,适合先批量试镜头

按具体入口配置

约 ¥119

约 ¥358

Seedance 1.5 Pro,720p,有声

旧款有声低成本档

已含有声档

约 ¥207

约 ¥622

Seedance 2.0 Fast,720p,当前优惠

偏效率,可用于迭代分镜

按具体入口配置

约 ¥360

约 ¥1,079

Seedance 2.0,720p

多模态参考、音画生成,适合角色与镜头控制

支持原生音画

约 ¥596

约 ¥1,788

Seedance 2.5,720p

最长 30 秒、多模态参考及多轮延长,适合复杂镜头和连续性控制

支持原生音画

约 ¥907

约 ¥2,722

Vidu Q3 Turbo,720p 图生

固定人物系列可结合参考生与主体库;此处价格仅为图生档

可带声

¥225

¥675

Vidu Q3 Pro,1080p 图生

较高分辨率图生档

可带声

¥450

¥1,350

MiniMax H3,768p

多模态参考、4–15 秒音画片段

原生音画

¥300

¥900

Hailuo 2.3 Fast,768p 图生

旧款低成本图生,适合旁白驱动的简单镜头

预算另配音

¥135

¥405

Wan 2.7 i2v,北京区,720p

首尾帧、续写、多镜头叙事;r2v 另有主体/音色参考

已含有声档

¥360

¥1,080

Wan 2.6 i2v Flash,北京区,720p

较低成本,最长 15 秒

有声/静音

¥180/¥90

¥540/¥270

可灵 3.0 系列/3.0 Turbo

多模态、主体连续性、分镜控制;官方已宣布系列原生 4K

支持音画同出

当前单价未核实

—

Veo 3.1 Lite/Fast/Standard,720p

Fast/Standard 支持参考图、首尾帧和延长;Lite 控制入口较少

原生声音开启

$30/$60/$240

$90/$180/$720

Runway Gen-4.5,720p

文生/图生;可先生成稳定角色图再驱动镜头

预算另配音

$72

$216

Runway Gen-4 Turbo,720p

较低价旧款图生档

预算另配音

$30

$90

Luma Ray3.2,720p SDR,5 秒段

首尾帧、关键帧控制;另有角色替换及视频编辑工作流

预算另配音

$36

$108

Pika 2.5,720p,5 秒段

文生/图生;另有关键帧模型可选

预算另配音

$24 + 会费

$72 + 会费

PixVerse V6/C1,720p,有声

参考生、首尾帧;V6 支持续写,C1 定位电影镜头与动作

已含有声档

$72/$78

$216/$234

Adobe Firefly Video API

文生/图生及 Adobe 后期流程衔接

配音/口型另有 API

统一公开单价未核实

—

Sora 2/Sora 2 Pro,720p

文生/图生;即将停用,见下方说明

原生音画

$60/$180

$180/$540

价格与能力来源、重要差异:

Seedance:火山官方价格、2.0 能力、2.5 能力。上述人民币价按 720×1280、24 fps、无视频输入估算。Mini 四折、Fast 七五折优惠到 2026-10-07 14:00 UTC+8;恢复常规价后,1,800 秒约为 ¥894/¥1,439。参考视频输入需要重新计算。

Vidu:官方价格、图生接口、角色参考与声音绑定。按常规任务计算;参考生、图生和错峰模式的价格不同。充值门槛与实际消耗金额也不同。

MiniMax:官方按量价格、视频接口指南。H3 768p 为 ¥0.50/秒;参考视频输入另计,第 6 张起的输入参考图另计。Hailuo 2.3 Fast 768p 按 6 秒 ¥1.35 或 10 秒 ¥2.25。

Wan:2.7 价格、2.6 Flash 价格。上表使用北京区 i2v;r2v 可能连同输入参考视频计费,不能照搬 i2v 总价。

可灵:官方 Q2 财报、Q1 财报。能力与版本已核实,当前官方 API 单价未核实,因此不估算。

Veo:官方价格、能力与限制。720p 每秒 $0.05/$0.10/$0.40;Preview,单次 4/6/8 秒,参考图模式要求 8 秒。不同入口价格可能不同。

Runway:官方价格、Gen-4.5 规格。Gen-4.5 为 $0.12/秒;不要把 Gen-4 Image 的参考图能力直接当作 Gen-4.5 视频 API 的能力。

Luma:官方价格、Ray 能力。720p SDR 为 $0.30/5 秒;若改用 10 秒段,每段 $0.90,600/1,800 秒变为 $54/$162。1080p、HDR 更贵。

Pika:官方价格、图生模型。720p 为 $0.04/秒,另有 $10/月 API Club 会费;首月赠额不作为长期单价抵扣。

PixVerse:官方价格、能力矩阵。使用按需充值 $10/1,000 积分的口径;视频参考输入会改变费率。

Adobe:视频 API 规格、独立音视频 API。不拿网页会员积分冒充统一 API 价。

Sora:Sora 2 价格、Pro 价格。官方公告 Videos API 及 Sora 2 系列将于 2026-09-24 停用,因此不作为新生产链的推荐依赖。停用公告

4. 配音与声音连续性

模型

适合用法

注意事项

MiniMax Speech 2.8 HD / Turbo

中文对白、旁白、固定角色音色;HD 偏质量,Turbo 偏速度

按官方国内价格,HD ¥3.5/万字符、Turbo ¥2/万字符;汉字按 2 字符计。声音设计/克隆另计

ElevenLabs Eleven v3 / Multilingual v2

v3 用于情绪对白、多说话人;v2 可用于较长旁白

音色与情绪标签要先试听;不同套餐计费不同

豆包语音合成 2.0 / 声音复刻 2.0

中文角色、口音、视频配音;可按上下文及指令调整情绪

控制能力随音色和接口而变;复刻参考不会保证逐字复现原音频情绪

单独的语音合成不会自动生成口型。对白近景需要额外口型同步,或采用原生音画生成后检查;旁白加环境镜头的制作通常更容易控制。即使支持原生声音,也要检查同一角色跨镜头音色是否稳定。

文档维护记录

2026-09-16:合并三个会话,核对实际角色素材,补充场景与剧情缺口,形成 D01–D06 成果清单、E01–E09 探索计划以及模型成本附录。