当前阶段:已完成流程与模型价格调研、一个虚构老板角色的二维资产包、六镜文字分镜示例。尚未生成真实视频或声音,尚未完成端到端样片或云手机自动化验证。下一步先做 6–8 秒单镜头,再做 30–60 秒完整故事,最后评估 10 分钟制作。
状态基准:2026-09-16。本文合并三个会话,并以当前文件核对实际交付。标注“已完成”仅指该行描述的产物;调研完成不等于效果实测完成。后续行动是建议顺序,尚未排定负责人、日期或批准付费实验预算。
一、目标与阶段判断
目标:验证固定虚拟演员能否稳定出演生活类短剧,并逐步形成可复用的角色、场景、分镜、声音和剪辑模板。样例故事采用“卤味店生意好 → 房东涨租 → 协商失败 → 老板搬到附近 → 房东跟开店 → 熟客回流 → 房东经营失败”。
当前路线以二维人物参考图与图生视频为主。角色编号用于资产管理;真正保持身份需要按模型要求上传参考图或绑定主体。当前没有三维网格、骨骼、材质等资产,也没有训练专属 LoRA。
状态 | 含义 | 目前对应内容 |
已完成 | 有可检查的文件或已交付的文字结论 | 流程说明、模型成本表、老陈 6 张图片与角色包、6 镜文字示例 |
已讨论,待验证 | 已提出方案;尚无实验结果或运行回执 | 视频角色一致性、中文对白与口型、模型效果优劣、云手机价值 |
后续探索 | 需要新执行的制作、比较或工程任务 | 视频试拍、补房东/熟客、样片剪辑、10 分钟预算实测、App 自动化 |
二、已完成成果与证据
编号 | 已完成内容 | 证据与边界 |
D01 | 制作链路与复用方法梳理 | 已解释剧本 → 角色库 → 文字分镜 → 分镜图 → 视频/声音 → 剪辑;人物复用与旧镜头复用需分别判断。没有具体账号的制作来源证据。 |
D02 | 主流模型与 10 分钟费用资料对比 | 已整理图像、视频和语音模型,统一按 600/1,800 秒测算。完成的是官方资料核查,不是横向效果实测。详见附录。 |
D03 | 老板“老陈”二维角色库 v1 | BOSS_CHEN_001,42 岁虚构中国男性;6 张 PNG、角色说明、实际图像提示词、预览 HTML 与 ZIP 已落地。 |
D04 | 单镜头试拍提示词 | 约 7 秒点头微笑无台词、约 7 秒一句话开口两套文字提示词。未实际生成对应视频或声音。 |
D05 | 30 秒文字分镜示例 | 6 镜 × 5 秒,已有景别、动作及声音设计思路。未生成这 6 镜的图片、视频或合成片。 |
D06 | 素材交付检查 | 角色预览、图片文件、资源链接及 ZIP 完整性有检查记录;本次复核 6 张 PNG 有效、ZIP 无损坏。动态效果仍待验证。 |
三、角色库与分镜现状
3.1 已有角色:老陈
固定特征:42 岁中国男性,略宽方脸、黑色侧分短发、两鬓少量灰白、无胡须眼镜,中等略壮身材。性格爽快细心,听人说话轻微点头。声音仅有“普通话、温和中低音、不紧不慢”的文字设定。
资产 | 用途 | 状态 |
01-master.png | 正面主参考,身份基准 | 已完成 |
02-angle-45.png / 03-profile.png | 45° 与 90°侧面半身参考 | 已完成;尚未验证视频转头连续性 |
04-scene.png | 便利店单人中景首帧 | 已完成;不是卤味店场景 |
05-outfit-casual.png / 06-outfit-winter.png | W02 灰绿夹克、W03 深棕开衫两套便装 | 已完成;一场戏保持一套服装 |
README / prompts.json / 制作记录 / HTML / ZIP | 角色规则、提示词、使用说明与可下载材料 | 已完成;图像实际使用内置 image_gen,未指定底层模型版本 |
房东、熟客 | 对手角色与顾客角色 | 后续探索:尚未建库 |
声音、主体绑定、动态视频 | 稳定音色与可复用的视频角色 | 后续探索:没有文件或绑定结果 |
完整角色库、六张独立图片及可复制试拍提示词通过以下网页访问;下载包保留现有素材原貌。
3.2 已有 30 秒文字分镜(整理版)
镜头 / 时长 | 主要画面与动作 | 制作目的 |
01 / 5 秒 | 卤味店门口,顾客排队 | 交代生意好与环境 |
02 / 5 秒 | 老板切肉 | 建立主人公与手艺 |
03 / 5 秒 | 房东递涨租通知 | 引入冲突 |
04 / 5 秒 | 老板摇头 | 表达不接受 |
05 / 5 秒 | 老板收起食品夹 | 表现决定收摊 |
06 / 5 秒 | 拉下卷帘门 | 结束这一段落 |
衔接缺口:现有图片是便利店,文字分镜是卤味店;现有 30 秒示例只到关店,尚未覆盖搬店、房东自营、熟客回流与结局。进入样片制作前,需要统一场景并补齐完整故事。
四、后续探索与验收条件
按下表顺序推进。每项通过后再扩大规模,优先得到可回看的样片与真实账单。表内验收条件是本次规划建议,不代表已完成或已承诺效果。
任务 / 优先级 | 下一步动作 | 交付与验收 |
E01 / P0:统一素材与剧本 | 保留现有便利店角色包作基线;为卤味店另建首帧和场景版本;补齐原故事后半段 | 完整故事梗概、角色/场景对应表;不把便利店首帧误标成卤味店 |
E02 / P0:首个 6–8 秒镜头 | 复用老陈,固定机位、单人、小动作、无台词;先验证人物动起来 | 可播放视频 + 输入图/提示词/模型/参数/费用;检查首中尾帧的脸、发际线、衣服和手部 |
E03 / P0:声音与开口 | 选定一版音色,以一句短台词测试原生音画或配音加对口型 | 声音与视频文件;复听文字准确性、音色、情绪,检查口型;记录是否成功绑定声音 |
E04 / P1:补角色与多人镜头 | 建立房东、熟客角色卡和独立参考图;先试双人同框,再试交替说话 | 两份角色包与双人短片;不串脸、不交换服装、说话人正确 |
E05 / P1:30–60 秒闭环样片 | 按完整冲突与结局拆镜,生成首帧/视频,完成声音、字幕和剪辑 | 一条有开端、冲突和结局的可播放样片;角色、服装、场景与声音连续 |
E06 / P1:模型同题比较 | 选择 2–3 个候选模型,用相同参考图测试单人、双人、店内多人三类镜头 | 保留全部尝试与账单,比较可用率、每可用秒费用、等待与人工修正时间;据结果选主力和备选 |
E07 / P2:10 分钟试制 | 复用通过审核的角色、场景与剪辑模板,记录整片重做和人工工时 | 10 分钟成片与实际全成本表;再决定批量生产是否值得 |
E08 / P1:云手机小试验 | 选一个必须通过 App 完成的环节,先做上传素材 → 填标题封面 → 保存草稿 | 建议连续 3 次运行成功且无重复上传;记录耗时、Agent 调用、人工接管、异常恢复与租赁成本 |
E09 / P2:批量编排 | 在样片及 App 试验通过后,增加任务状态、素材版本、失败重试与记录 | 同一输入可追溯到模型任务和成片;重试不重复付费提交或重复发布;建立人工接管入口 |
可后置探索:角色 LoRA、三维演员、复杂长镜头、全自动剪辑与批量分发。当前二维参考图路线尚未完成动态验证,先依据样片的实际瓶颈决定是否引入这些方案。
五、模型分工与预算原则
步骤 | 候选工具类别 | 选型判断 |
剧本与文字分镜 | GPT / Claude / Gemini / DeepSeek / Qwen / 豆包 / Kimi 等 | 剧情可理解、动作可拍、台词适配时长、结构化输出稳定 |
角色和分镜图片 | Seedream / GPT Image / Nano Banana / FLUX / Midjourney / Firefly | 多参考图能力、同一角色换角度/服装/场景的成功率 |
图生视频 | Seedance / Vidu / MiniMax / Wan / 可灵 / Veo / Runway / Luma / Pika / PixVerse 等 | 先检查人物和动作可用性,再比较每可用秒费用 |
声音 | 原生音画或 MiniMax Speech / ElevenLabs / 豆包语音 | 中文台词、角色音色、情绪、口型及跨镜头声音一致性 |
剪辑 | 剪映/CapCut、Premiere、DaVinci Resolve;模板可用 FFmpeg | 节奏和声画连续性优先;剪辑工具与模型分开记录 |
统一比较假设:10 分钟为 600 秒;按生成 1,800 秒、采用 600 秒预留预算。“3 倍生成量”是测算假设,没有实测证明各模型通过率相同。人民币与美元分开,不混 API 消耗与网页会员额度。
完整成本 = 视频生成 + 人物/分镜图 + 配音/口型 + 剪辑工具 + 人工 + 云手机/Agent/存储。有效生成成本 = 所有计费尝试总费用 ÷ 最终采用的视频秒数。
示例:Vidu Q3 Turbo 视频生成费 ¥675 + 其他素材/工具假设 ¥100 + 人工假设 20 小时 × ¥80 = ¥2,375,再加实际云手机费用。这是预算演算,尚无本项目的真实成片账单,也不是市场报价。
六、云手机:优势、痛点、竞争方案与验证
推荐分工:主控程序管理剧本、任务和素材;模型 API 生成图片、视频及配音;电脑或服务端剪辑;云手机承接必须通过移动 App 完成的操作、预览和交付。云手机主要节省操作工时,模型推理费用仍要支付。
候选角色 | 可执行动作 | 当前状态 / 下一步 |
无 API 的创作入口 | 传参考图、填提示词、查询进度、取结果 | 已讨论,待验证目标 App 兼容性及后台任务恢复 |
素材交接与移动模板 | 上传素材、套字幕/封面模板、导出 | 已讨论,待测文件格式、导出限制与操作工时 |
移动端检查 | 检查竖屏裁切、字幕遮挡、封面、播放 | 已讨论,需建立检查清单并留人工复核 |
发布准备 | 上传成片、填标题、选封面、存草稿 | 建议作为首个小试验;正式发布按用户授权执行 |
账号环境与数据回收 | 保留获授权账号环境,读取自己的创作者数据 | 已讨论,待验证登录、接口可用性与获取范围 |
净节省 = 减少的人工时间 × 人工时薪 − 云手机租赁 − 带宽/存储 − GUI Agent 调用 − 异常处理成本。按账号环境和操作并发分配实例,不需要每个模型一台手机。
云手机官方 API:应用、文件、截图与 Agent 任务能力
6.1 是否有优势:先明确比较对象
结论:云手机对 AI 视频的优势主要在“移动 App 执行与交付”。视频生成、人物一致性和复杂剪辑并不会因换到云手机自然改善。有稳定官方 API 的步骤,优先比较 API 编排;有完整网页/桌面功能的步骤,优先比较网页/桌面;只有移动端功能必须保留、重复操作量足够大、异常接管可控时,云手机才更可能划算。以下优势和优先级是分析判断,尚未经本项目实测。
基础云手机提供远程 Android 环境;自动点选、任务编排与素材交接还需要 GUI Agent、RPA 或素材服务。下文涉及节省重复操作的收益,均指云手机与这些能力组合后的方案;单独租用云手机不会自动完成制作流程。
比较对象 | 云手机可能提供的优势 | 优势成立的条件 |
人工操作多台实体手机 | 远程分配工作位,集中保留 App 状态,减少设备采购、充电与交接;自动化另可减少重复操作 | 需要多个长期移动环境;实例利用率足够高、兼容目标 App,并配套可用的自动化 |
模型 API 编排 | 覆盖未开放 API 的移动专属模板、编辑功能或交付步骤 | 该能力确实无法用已有 API 等效完成;生成价格差额单独核算 |
桌面/网页自动化 | 保留目标 Android App 的原生操作入口和草稿环境 | 网页端缺关键能力,或同任务的手机流程实测更省工时 |
普通云手机租赁 | 若叠加行业模板、素材交接、任务回执、失败恢复与人工接管,可交付更完整的业务结果 | 这些能力要实际实现并在目标 App 上验证;仅提供 Android 实例不是新增差异化 |
6.2 用户痛点:哪些能解决,哪些仍在
痛点 | 云手机作用 | 仍需解决的问题 |
人物变脸、串脸、服装漂移 | 直接作用低;只能代为调用生成和重做功能 | 角色参考、主体绑定、模型选择、镜头约束和质量审核 |
剧情不连贯、对白口型不准、镜头不可用 | 直接作用低;不会提升所调用模型的能力 | 剧本/分镜、配音/口型工具、剪辑及重做;记录每可用秒成本 |
生成太贵或服务端排队久 | 通常无直接优势;手机并发不等于模型吞吐增加 | 模型费、入口套餐、配额、可用率;避免手机或 Agent 为等待任务持续占用资源 |
没有 API 的 App 反复点选 | 有条件优势;GUI Agent 或固定流程可代办 | 页面改版、弹窗、加载时序、登录失效与非标准控件;需要异常恢复 |
跨 App 导入导出大视频 | 接入素材服务与自动化后可减少人工搬运,但可能增加传输与存储成本 | 统一素材库、格式与目录映射、去重、上传回执,核算文件传输耗时 |
多账号环境、多人交接与发布准备 | 相对手工真机有潜在管理优势 | 仅使用获授权账号;测登录保持、草稿状态与人工接管;正式发布依授权执行 |
少量作品、频繁临场改剧情或精细剪辑 | 优势弱;搭建与维护成本难摊薄 | 先用现有电脑/手机与创作工具完成样片,观察真正重复的工作 |
方案成本包括实例租赁、远程交互与文件传输、App 版本维护、登录处理和异常人工接管;采用 GUI Agent 时另有推理费,使用其他自动化也应核算其费用。一次“自动点完”只能证明通路存在,不能证明可靠、低成本或提高产能。云手机预览可检查版式与 App 展示,但不覆盖所有实体设备的色彩、音质、传感器及编码差异。
6.3 竞争方案:既有替代路径,也有直接竞品
方案 / 示例 | 主要优势 | 主要痛点 / 云手机需要证明什么 |
官方 API + n8n / 自建任务系统 | 参数明确,支持批量任务、状态回调、结果归档,等待不必占用手机界面 | 需要开发、配额与存储治理;若 API 能等效覆盖,云手机额外点击步骤通常缺少必要性 |
ComfyUI + 本地或云 GPU | 可编辑节点流程、模型与生成参数;可通过服务端接口编排 | 需 GPU、显存及节点/模型版本维护;适合生成控制,不能替代手机独有交付环节 |
网页 / 桌面 + 自动化 | 即梦网页已有生成入口;适配桌面素材处理;有 DOM 时可用结构化定位 | 仍可能受界面变化影响;需逐项核对网页和手机是否功能相同 |
一体化创作平台:Runway Workflows、CapCut 桌面 | 内置生成、素材编辑与工作流,减少跨工具交接和搭建工作 | 模型、模板、会员权益和地区能力受产品限制;其已覆盖的流程不必再经云手机重做 |
实体手机 + 人工 / 自动化 | 直接验证目标 App 在实际设备上的表现;低量任务可立即起步 | 批量时有采购、充电、设备维护与交接成本;需比较有效总成本,而非只比租金 |
云手机 + GUI Agent / RPA | 承接 Android App 的专属步骤,保持移动环境,远程执行和接管 | 需解决兼容性、界面漂移、失败恢复、重复提交与素材搬运;不保证天然优于其他路径 |
直接相邻竞品:GeeLark | 官网已列出 AI 图像/视频、素材库、Android 云手机、RPA 与社媒发布模板 | “AI + 云手机 + 自动化”已有产品;还要比较目标 App 覆盖、恢复能力、团队流程和单位任务成本 |
产品事实边界:GeeLark 官网主要展示 TikTok、Instagram、YouTube Shorts 等社媒流程,不据此推断它已适配国内抖音/快手,也不将厂商宣传视为稳定性实测。CapCut 的已核实能力不直接等同于国内剪映。网页存在不等于开放 API,各端模板、音色、模型、会员权益和导出能力需要逐项核对。
竞争判断:更值得验证的产品定位是“为某类视频团队交付可追溯、可恢复的移动 App 工作流程”。差异化候选包括国内目标 App 的稳定适配、素材与项目绑定、人工接管、版本维护和每条成功交付成本。单独提供云手机或通用点击 Agent,尚不足以证明优势。
6.4 如何判断划算:按成功交付核算
先比较同质量、同素材、同最终结果下的路径。云手机、网页与 API 的模型/会员价格可能不同,差额需要纳入;不能假设手机会员折算价等于 API 价,也不能默认走 App 更便宜。
月度净收益 = 成功交付量 ×(每次成功交付节省的人工分钟 ÷ 60 × 人工时薪 − 每次成功交付新增变量成本)− 相对基线新增固定成本。人工分钟包含所有失败与接管的摊销;变量成本按 Agent、模型、传输等账单分类各计一次,包含失败与重试消耗;新增固定成本包含实例租赁、开发与维护相对基线的差额或摊销。
如果每次成功交付的净节省小于或等于零,增加任务量通常无法靠规模扭转。若净节省为正,盈亏平衡成功交付量 = 新增固定成本 ÷ 每次成功交付净节省;还要验证并发扩张后是否需要增加实例与人工。
6.5 后续探索:把 E08 从“跑通”升级为对照验证
步骤 | 验证办法 | 决策输出 |
确认移动端必要性 | 选一个真实环节,列出 API、网页、桌面、手机功能差异,确认 App 独有价值 | 如果现有接口或桌面方案已满足目标,优先采用更简单的路径 |
少量通路试验 | 原 E08 的连续 3 次成功仅作为冒烟检查;先保存草稿,不以自动公开发布作为起点 | 得到失败类型、恢复方法与最小可执行流程 |
同题对照 | 建议再取 20–30 个代表任务做初步对比:人工/桌面、可用 API 或平台工作流、云手机;覆盖正常及异常路径 | 记录成功率、人工分钟、总耗时、模型费、设备/Agent费、传输、重试与重复提交 |
是否继续投入 | 以成功交付一次所需的全成本及可控性做判断;小样本仅支持初步判断 | 存在明确移动功能价值且净节省为正,再扩大试验;主要痛点在生成质量时,优先投入模型和素材制作 |
6.6 本次补充的一手来源
n8n:HTTP Request 节点支持 API、文件和批量请求
补充状态:优势、痛点与竞争方案调研已完成;目标 App 的功能差异、稳定性、节省工时和商业收益尚未实测。
七、实验记录与推进规则
记录类别 | 每次至少保留的字段 |
素材与输入 | 实验编号、角色/服装/场景版本、输入图、提示词、目标镜头和台词 |
模型与执行 | 服务与模型版本、入口/API、分辨率、时长、声音设置、任务 ID、开始/完成时间 |
质量与成本 | 采用/弃用及原因、每次扣费、总生成秒数、可用秒数、人工分钟数 |
声音检查 | 台词准确、说话人、音色、情绪、口型、跨镜头连续性 |
云手机试验 | App 版本、步骤、成功/失败点、Agent 调用、人工接管、是否重复提交、恢复结果 |
初次制作前需选定候选模型入口、实验预算上限和目标画幅。当前示例可按竖屏、小动作镜头起步;具体执行时再确认这些参数。没有证据的能力继续标为待验证,有视频/账单/日志并完成检查后才更新为已完成。
八、来源与更新方式
原会话标题 | 本规划吸收的内容 |
分析AI短剧加工流程 | 全链路、人物复用、长片与分镜、模型费用、云手机分工 |
定人物为老板、房东、熟客选定形象,保存不同角度和常用服装的参考图可反复使用的角色库. ai视频中的人物具备哪些要素,另… | 角色需求、老陈资产包、二维与三维澄清、试拍提示词 |
解释AI视频拆分镜操作 | 6 镜 × 5 秒示例、景别/动作/声音、单镜头体验方法 |
以上为应用返回的会话标题;角色会话标题在应用中已截断,以省略号保留。完成状态另用角色库 README、制作记录、PNG、提示词与 ZIP 核对。原始会话与本地素材不因本次整理而更改。
钉钉和网页由同一份规划正文生成,本次交付为 2026-09-16 快照;没有配置持续自动同步。后续在 E01–E09 行更新状态并附产物/费用,再同步两端,避免一处已完成、一处仍待验证。
附录:模型、效果与价格资料快照
以下沿用 2026-09-16 已核对的官方资料。效果简介是能力定位,不是本项目实测排名。优惠、版本与可用状态在实际采购前需复核;未核实的价格保留空缺。
2. 人物定妆与分镜图片
模型家族 | 适合环节与效果简介 | 需要留意 |
中文场景、人物定妆、多图合成与局部修改;Pro 可用于多人同框、店铺招牌等较复杂图片 | 细小文字和精细一致性仍需检查;Pro、Lite 与产品入口开放能力有差异 | |
定妆图、参考图编辑、人物换场景、局部修改;Sunburst 偏编辑精度,Flare 偏快速生成与日常编辑 | 连续镜头仍要检查脸、服装、道具;按 token 计费,不能用一个固定“每张价”覆盖所有设置 | |
分别为 Gemini 3.1 Flash Image / Gemini 3 Pro Image;多参考图、自然语言编辑,适合角色分镜与反复修改 | 2 Lite 偏成本与速度,不以多参考图及连续多轮编辑为主要优化方向 | |
整体画风、人物视觉设计、场景质感;Edit Model 可用最多 4 张参考图组合与修改 | 多人特征可能混淆;旧版 V7 的 Omni Reference 教程不能直接套用到 V8.X。参见版本说明 | |
真人质感、多图参考和人物/服装/场景组合;适合接入批处理流程 | 不同版本和入口的参考图数量、成本不同,详见多参考图限制 | |
场景图、封面及后期修图;便于结合构图、风格参考及 Adobe 后期工具 | 风格相似不保证人物身份一致;Firefly 平台也承载外部模型 |
旧教程常见的 Imagen 4:Gemini API 的 standard/ultra/fast 端点已于 2026-08-17 关闭,该 API 新项目应按官方迁移建议选型。这一结论不代表所有第三方平台上的 Imagen 都已下线。官方生命周期说明
图像费用量级示例:Seedream 5.0 Pro 在不超过 261 万像素档为 ¥0.30/张,Lite 为 ¥0.22/张;Pro 第 2 张输入参考图起另收 ¥0.02/张。因此 100 张 Pro 输出的基础生成费约 ¥30,输入参考图与重做另算。火山官方价格
3. 图生视频及 10 分钟成本对比
统一口径:600 秒成片全部使用新生成画面;“生成 1,800 秒”是假设生成 3 倍素材、最终采用 600 秒。它只是预算比较假设,各模型实际可用率没有经过本表实测。
以下是 API 视频生成消耗,通常按 720p 或最接近档位;不含人物图、额外配音、剪辑、人工、云手机及其他订阅费用。人民币和美元分别列出;不用网页会员价代替 API 价。输入参考视频可能另计费。
模型/比较规格 | 效果与使用定位简述 | 声音口径 | 生成 600 秒 | 生成 1,800 秒 |
Seedance 2.0 Mini,720p,当前优惠 | 低价档,适合先批量试镜头 | 按具体入口配置 | 约 ¥119 | 约 ¥358 |
Seedance 1.5 Pro,720p,有声 | 旧款有声低成本档 | 已含有声档 | 约 ¥207 | 约 ¥622 |
Seedance 2.0 Fast,720p,当前优惠 | 偏效率,可用于迭代分镜 | 按具体入口配置 | 约 ¥360 | 约 ¥1,079 |
Seedance 2.0,720p | 多模态参考、音画生成,适合角色与镜头控制 | 支持原生音画 | 约 ¥596 | 约 ¥1,788 |
Seedance 2.5,720p | 最长 30 秒、多模态参考及多轮延长,适合复杂镜头和连续性控制 | 支持原生音画 | 约 ¥907 | 约 ¥2,722 |
Vidu Q3 Turbo,720p 图生 | 固定人物系列可结合参考生与主体库;此处价格仅为图生档 | 可带声 | ¥225 | ¥675 |
Vidu Q3 Pro,1080p 图生 | 较高分辨率图生档 | 可带声 | ¥450 | ¥1,350 |
MiniMax H3,768p | 多模态参考、4–15 秒音画片段 | 原生音画 | ¥300 | ¥900 |
Hailuo 2.3 Fast,768p 图生 | 旧款低成本图生,适合旁白驱动的简单镜头 | 预算另配音 | ¥135 | ¥405 |
Wan 2.7 i2v,北京区,720p | 首尾帧、续写、多镜头叙事;r2v 另有主体/音色参考 | 已含有声档 | ¥360 | ¥1,080 |
Wan 2.6 i2v Flash,北京区,720p | 较低成本,最长 15 秒 | 有声/静音 | ¥180/¥90 | ¥540/¥270 |
可灵 3.0 系列/3.0 Turbo | 多模态、主体连续性、分镜控制;官方已宣布系列原生 4K | 支持音画同出 | 当前单价未核实 | — |
Veo 3.1 Lite/Fast/Standard,720p | Fast/Standard 支持参考图、首尾帧和延长;Lite 控制入口较少 | 原生声音开启 | $30/$60/$240 | $90/$180/$720 |
Runway Gen-4.5,720p | 文生/图生;可先生成稳定角色图再驱动镜头 | 预算另配音 | $72 | $216 |
Runway Gen-4 Turbo,720p | 较低价旧款图生档 | 预算另配音 | $30 | $90 |
Luma Ray3.2,720p SDR,5 秒段 | 首尾帧、关键帧控制;另有角色替换及视频编辑工作流 | 预算另配音 | $36 | $108 |
Pika 2.5,720p,5 秒段 | 文生/图生;另有关键帧模型可选 | 预算另配音 | $24 + 会费 | $72 + 会费 |
PixVerse V6/C1,720p,有声 | 参考生、首尾帧;V6 支持续写,C1 定位电影镜头与动作 | 已含有声档 | $72/$78 | $216/$234 |
Adobe Firefly Video API | 文生/图生及 Adobe 后期流程衔接 | 配音/口型另有 API | 统一公开单价未核实 | — |
Sora 2/Sora 2 Pro,720p | 文生/图生;即将停用,见下方说明 | 原生音画 | $60/$180 | $180/$540 |
价格与能力来源、重要差异:
Seedance:火山官方价格、2.0 能力、2.5 能力。上述人民币价按 720×1280、24 fps、无视频输入估算。Mini 四折、Fast 七五折优惠到 2026-10-07 14:00 UTC+8;恢复常规价后,1,800 秒约为 ¥894/¥1,439。参考视频输入需要重新计算。
Vidu:官方价格、图生接口、角色参考与声音绑定。按常规任务计算;参考生、图生和错峰模式的价格不同。充值门槛与实际消耗金额也不同。
MiniMax:官方按量价格、视频接口指南。H3 768p 为 ¥0.50/秒;参考视频输入另计,第 6 张起的输入参考图另计。Hailuo 2.3 Fast 768p 按 6 秒 ¥1.35 或 10 秒 ¥2.25。
Wan:2.7 价格、2.6 Flash 价格。上表使用北京区 i2v;r2v 可能连同输入参考视频计费,不能照搬 i2v 总价。
可灵:官方 Q2 财报、Q1 财报。能力与版本已核实,当前官方 API 单价未核实,因此不估算。
Veo:官方价格、能力与限制。720p 每秒 $0.05/$0.10/$0.40;Preview,单次 4/6/8 秒,参考图模式要求 8 秒。不同入口价格可能不同。
Runway:官方价格、Gen-4.5 规格。Gen-4.5 为 $0.12/秒;不要把 Gen-4 Image 的参考图能力直接当作 Gen-4.5 视频 API 的能力。
Luma:官方价格、Ray 能力。720p SDR 为 $0.30/5 秒;若改用 10 秒段,每段 $0.90,600/1,800 秒变为 $54/$162。1080p、HDR 更贵。
Pika:官方价格、图生模型。720p 为 $0.04/秒,另有 $10/月 API Club 会费;首月赠额不作为长期单价抵扣。
PixVerse:官方价格、能力矩阵。使用按需充值 $10/1,000 积分的口径;视频参考输入会改变费率。
Adobe:视频 API 规格、独立音视频 API。不拿网页会员积分冒充统一 API 价。
Sora:Sora 2 价格、Pro 价格。官方公告 Videos API 及 Sora 2 系列将于 2026-09-24 停用,因此不作为新生产链的推荐依赖。停用公告
4. 配音与声音连续性
模型 | 适合用法 | 注意事项 |
中文对白、旁白、固定角色音色;HD 偏质量,Turbo 偏速度 | 按官方国内价格,HD ¥3.5/万字符、Turbo ¥2/万字符;汉字按 2 字符计。声音设计/克隆另计 | |
v3 用于情绪对白、多说话人;v2 可用于较长旁白 | 音色与情绪标签要先试听;不同套餐计费不同 | |
中文角色、口音、视频配音;可按上下文及指令调整情绪 | 控制能力随音色和接口而变;复刻参考不会保证逐字复现原音频情绪 |
单独的语音合成不会自动生成口型。对白近景需要额外口型同步,或采用原生音画生成后检查;旁白加环境镜头的制作通常更容易控制。即使支持原生声音,也要检查同一角色跨镜头音色是否稳定。
文档维护记录
2026-09-16:合并三个会话,核对实际角色素材,补充场景与剧情缺口,形成 D01–D06 成果清单、E01–E09 探索计划以及模型成本附录。

