如果只看产品介绍,Pavo 很有吸引力:不需要在文生图、图生视频、配音、剪辑工具之间来回切换,只要描述一个想法,AI 就能把它变成一部短片。Pavo 在 App Store 的版本说明里,甚至把新上线的 Short Drama Mode 概括为“用一句话描述想法,AI 完成从故事到视频的工作”。对没有视频制作经验的人来说,这几乎就是理想中的创作入口。
但“能生成一条视频”和“能交付一部短剧”,中间还隔着多远?
为了回答这个问题,我没有使用一句简单提示词,而是截取了小说《将门毒后》第一章中的同一段内容,连续做了两轮测试。这段文字包含人物关系、前史、宫廷空间、关键道具、情绪转折和多段对白,还要求角色在不同镜头里保持基本一致。它更接近一个真正的短剧改编任务,靠几个漂亮空镜很难蒙混过关。
两轮使用了同一段小说文本,也沿用了 Pavo 相同的八步创作流程,最大的变量是底层生成模型。第一轮直接使用 Pavo/Agnes 默认模型,也就是产品对外宣传中所说的“自研模型”;第二轮则把图片生成切换为 Doubao Seedream 5.0 lite,把视频生成切换为 Doubao Seedance 2.0 Fast。前者负责角色、场景、道具和关键帧,后者负责把关键帧转成分镜视频。
这个变量一换,结果出现了明显差异。第一轮在角色设定、关键帧和人物动作上暴露出较多崩坏,第二轮的角色形象、视觉统一性和视频稳定性都有提升。但两轮都没有解决镜头衔接与转场问题,成片也分别只有 132.63 秒和 112.78 秒,没有稳定达到任务设定的约 180 秒。
这里还需要先处理一个事实边界。Agnes 官方开发文档确实列出了 Agnes Image 和 Agnes Video V2.0 等自有品牌模型,媒体报道也把它们称为自研模型;但现有公开材料没有提供模型架构、训练数据、技术报告或模型来源说明,无法独立判断这些模型是从头训练、基于其他模型继续训练,还是经过路由和工程封装。因此,本文统一使用“Pavo/Agnes 默认模型(对外称自研)”,不把“自研基础模型”当成已经完全核实的事实。
这两轮测试也把 Pavo 的产品价值拆得更清楚了。第一步到第三步,以及第五步,主要依赖产品的工作流设计,确实能指导没有经验的用户确认需求、整理剧本、建立视觉方向和完成分镜脚本。到了第四步、第六步和第七步,结果质量开始明显受底层图片与视频模型影响。Pavo 降低了 AI 视频创作的操作门槛,却未必降低总创作成本;它能组织生产,但还不能保证生产结果通过验收。
Pavo 已经把“怎么做一部 AI 短剧”变成了一条小白也能跟着走的路径。它接下来要解决的,是怎样选择更合适的模型,以及怎样让用户判断生成结果究竟能不能用。
一、Pavo 做的并不只是视频生成,而是把一条生产链装进对话框
Pavo 官方把自己定位为一体化的 AI 图片与视频创作工具,强调不需要复杂编辑,用户选择风格或模板后即可快速生成动态内容。单看这个描述,它与市面上大量“文生视频”“图生视频”工具并没有本质差异。真正让我感兴趣的,是剧情短片模式背后的产品结构。
从小说片段到成片,系统拆成了八步
在这次测试里,Pavo 没有收到文本后立刻吐出一个视频文件,而是把任务拆成了八个阶段:需求确认、剧本大纲、角色与场景及道具设计、视觉资产生成、分镜脚本、分镜关键帧、分镜视频和最终合成。
第一步,系统先把小说片段整理成一张需求卡,提取标题、梗概、时长、画幅、视觉风格和戏剧类型。测试中的设置为约 180 秒、9∶16 竖屏、对话剧模式和宫斗权谋的冷峻视觉风格。第二步,它继续拆解人物、场景、关键道具和剧情段落。随后,系统为六名人物、两个主要场景和两件道具建立文字设定,再生成角色全身图、四视图、场景图和道具图。完成这些准备后,它才进入分镜脚本、关键帧、单镜头视频和成片合成。
真正降低的是流程认知成本
这套流程的产品价值,更多体现在它替用户承担了大量流程组织工作。单张图或单个镜头是否比其他模型更惊艳,反而没有那么关键。
如果不用 Pavo,用户通常要在剧本、人物参考图、分镜提示词、视频、配音和剪辑工具之间切换,还要自己维护素材与版本。一个参考图放错或镜头顺序混乱,都可能带来连锁返工。
Pavo 把这些环节放进了同一个项目空间。用户面对的是一条按阶段推进的任务,而非十几个分散的模型接口。人物设定、四视图、场景、道具和关键帧会保留在页面里,供后续步骤继续引用。对第一次制作 AI 短剧的人来说,这种流程封装的价值很实际,它减轻了记住“下一步该干什么”的认知负担。
自动化越深,验收越要前置
不过,流程封装也会带来一个新的问题:当系统替用户做了更多决定,用户往往更难知道应该在哪一步介入。自动化程度越高,验收机制就越重要。否则,用户很容易在八个阶段全部变绿之后才发现,真正不满意的是第二步的剧情压缩,或者第四步的人物设定。
图 1:Pavo 的八步工作流。第一至三步和第五步主要承担创作指导,第四、六、七步更依赖底层生成模型。
二、同一流程换一套模型,差异集中出现在第四、六、七步
如果两轮都使用默认模型,只能观察生成的随机性。这次第二轮主动更换了图片和视频模型,因此更像一次控制变量不算完全严格、但很有产品价值的 A/B 测试:输入文本相同、产品流程相同,底层生成模型不同。它可以帮助我们区分,哪些结果来自 Pavo 的工作流设计,哪些更依赖图片和视频模型本身。
先把流程价值与模型能力拆开看
| 对比项 | 第一轮 | 第二轮 |
|---|---|---|
| 输入材料 | 《将门毒后》第一章同一片段 | 《将门毒后》第一章同一片段 |
| 图片生成 | Pavo/Agnes 默认模型(对外称自研) | Doubao Seedream 5.0 lite |
| 视频生成 | Pavo/Agnes 默认模型(对外称自研) | Doubao Seedance 2.0 Fast |
| 最终时长 | 132.63 秒 | 112.78 秒 |
| 视频规格 | 704×1280,H.264,AAC 双声道 | 720×1280,H.264,AAC 双声道 |
| 整体结果 | 角色、关键帧和动态镜头问题较明显 | 视觉与动态质量明显提升,转场问题仍然存在 |
第一步到第三步的差距并不大。需求确认、剧本大纲和视觉设计总览主要由 Pavo 的流程和文本能力驱动。系统会追问时长、画幅、风格与戏剧类型,再把原文整理成人物、场景、道具和剧情段落。即使用户没有改编经验,也能沿着页面给出的结构继续确认。这部分价值相对稳定,不会因为换了生图模型就完全失效。
第四步:角色资产先拉开差距
真正的差异从第四步“角色、场景与道具图”开始出现。
第一轮使用 Pavo/Agnes 默认模型时,场景环境和关键道具的结果基本可用。冷宫寝殿、回忆朝堂、三尺白绫和龙纹朝靴都能建立相应的视觉方向,其他角色立绘也能承担基础参考作用。问题主要集中在主角沈妙身上。她是后续十二个分镜的视觉中心,一旦角色立绘不符合人物气质,后面的关键帧和视频就会继承这个偏差。第一轮的沈妙形象与预期距离较大,这让角色资产虽然“生成成功”,却没有真正完成主角定型。
第二轮把图片模型切换为 Seedream 5.0 lite 后,角色设计的改善最明显。主角与配角的造型更完整,人物、场景和道具处于更统一的视觉体系中。这里不能简单把差异全部归功于某个模型参数,因为两次生成仍然包含随机性;但在同一故事和同一流程下,模型切换后多个资产同时改善,至少说明第四步的质量上限高度依赖底层图片模型。
第六步:关键帧暴露质量边界
第六步“分镜关键帧”把这种差距进一步放大。第一轮共生成十二个关键帧,其中分镜 2 和分镜 12 出现了非常明显的马赛克和画面崩坏,已经影响到镜头是否可用。分镜 8 出现较强的流血画面,整体视觉也偏暗、偏血腥,与最初选择的宫斗权谋冷峻风格存在一定偏移。系统完成了十二张图,却没有识别哪些图已经越过风格边界,哪些图在技术上就应该重做。
第二轮的关键帧在风格统一性上提升明显。人物服装、冷宫空间和整体影调更容易被看作同一部片子,构图和角色关系也更稳定。不过,整体色调依旧偏暗。这说明模型替换改善了生成质量,但没有自动解决视觉指导问题。“冷峻”被模型理解成“低照度、深色、雨夜”后,如果产品没有亮度、血腥程度或情绪强度等更细的控制项,结果仍可能在统一的同时偏离用户预期。
第七步:视频模型变强,转场依旧难
第七步“分镜视频”是两轮差异最大、也最能暴露产品边界的地方。第一轮中,人物在做具体动作时容易出现面部崩坏、肢体扭曲和动作不连贯,部分镜头从静态关键帧进入运动后,角色形象发生明显变化。分镜 2 和分镜 12 的马赛克问题也延续到了视频阶段。单个任务可以正常返回文件,连续观看却会感到人物动作不自然,镜头之间缺少顺畅的承接,最终成片质量并不理想。
换成 Seedance 2.0 Fast 后,人物动作和面部稳定性有了非常明显的提升。第二轮至少更接近一条可以完整观看的剧情样片,而非一组勉强拼在一起的动态素材。但提升没有覆盖所有问题。镜头衔接和转场仍然生硬,有些动作在上一个镜头结束时还没有完成,下一个镜头已经切换到新的机位或情绪;角色在相邻镜头中的位置、视线和动作方向也未必连续。
绿灯亮了,不代表交付达标
这组结果给出了一个很清楚的分界:第一、二、三、五步体现的是 Pavo 作为创作工作流的价值,第四、六、七步则把质量控制权交给了底层生成模型。更换更合适的模型可以明显提高资产和动态镜头质量,却无法自动解决跨镜头叙事与转场。后者属于整个工作流需要负责的问题,不能只等下一代视频模型变强。
两轮基础合成链路都是完整的,没有发现长时间黑屏、明显冻结或音轨中断。第一轮成片为 132.63 秒,第二轮为 112.78 秒,两者相差近 20 秒。若都按约 180 秒目标衡量,第一轮约完成 73.7%,第二轮约完成 62.7%。页面仍将任务标记为完成,说明内部生成状态与最终交付标准之间存在缺口。
图 2:同一段小说、同一套流程,更换图片与视频模型后,差异主要集中在角色资产、关键帧和分镜视频。画面为两轮成片抽帧。
三、Pavo 对小白最有价值的部分,是创作流程本身
如果只因为最终视频不够理想就否定 Pavo,也不公平。两轮体验中,第一步到第三步和第五步都给我留下了相对稳定的正面感受。它们不一定直接决定画质,却把原本只有编剧、导演或有经验的 AI 创作者才熟悉的思考顺序,变成了普通用户可以跟随的页面流程。
先用需求卡把模糊想法说清楚
第一步是需求确认。很多人拿到一段小说后,只知道“我想把它做成视频”,却说不清标题、梗概、目标时长、画幅、视觉风格和戏剧类型。Pavo 会先从原文中提取一版需求,再让用户确认。这张需求卡的意义类似一份极简创作 Brief:它未必专业到可以直接开拍,却能阻止任务在目标尚未说清时就进入高成本生成。
把小说拆成可调用的叙事元素
第二步是剧本大纲。小说不是分镜脚本,文字里的回忆、心理、人物关系和背景信息无法直接变成镜头。Pavo 会梳理主要人物、场景、道具和剧情段落,再把三尺白绫、龙纹朝靴、冷宫寝殿和回忆朝堂转成可被后续流程调用的元素。用户不必从空白页面开始学习如何改编,至少可以围绕系统给出的初稿删改。
先定视觉标准,再进入图片生成
第三步是视觉设计总览。系统会先用文字描述人物外形、服装、性格、场景氛围和道具质感,再进入真正的图片生成。这一步很容易被忽略,却适合小白建立最初的视觉标准。即使第一轮沈妙的立绘不符合预期,用户也能回到文字设定判断问题究竟来自描述偏差,还是图片模型没有执行好。
一份可以继续修改的拍摄清单
第五步是分镜脚本。Pavo 会把剧情拆成十二个镜头,列出景别、运镜、画面、台词和时间。对于没有分镜经验的人来说,这相当于一份可以继续修改的拍摄清单。它不保证镜头语言足够成熟,但至少让用户理解,一段小说必须被拆成有限时长、有限信息量的连续画面。
这四步共同把模糊创意转成结构化生产资料,降低了操作、工具和流程门槛。但情绪停留多久、主角是否符合原著、表演是否成立,仍需要用户判断。Pavo 节省的是从零搭建流程的时间,并没有自动提供审美标准和导演判断。
四、“12/12 成功”为什么不是用户需要的成功
Pavo 页面里的成功状态主要描述技术任务:图片是否生成、关键帧是否返回、视频任务是否完成、文件是否合成。这些指标当然重要。如果生成接口频繁报错、资产丢失或者合成失败,用户连验收内容的机会都没有。
技术完成,不等于内容可用
但在第一轮中,分镜 2 和分镜 12 即使已经出现肉眼可见的马赛克与崩坏,系统仍把它们计入 12/12 生成成功,并继续送入视频生成和最终合成。这说明当前“成功”主要对应任务返回状态,还没有覆盖最基础的画面质量判断。
一条短片至少有四层验收标准
问题在于,技术完成只是内容交付的前置条件。剧情短片至少还有四层质量需要判断。
第一层是规格符合度,包括时长、画幅、分辨率、音轨和字幕是否符合需求。这次最清楚的问题就是时长。用户设定约 180 秒,两轮输出却分别停在 132.63 秒和 112.78 秒。即使“约”允许一定浮动,超过四十秒甚至六十秒的差距也不应只被当作普通波动。
第二层是叙事完整度。两轮成片都能传达废后受辱、沈家被害和帝王背叛等主要信息,但较依赖对白和文字说明。部分画面只是在“陪着台词播放”,没有真正承担叙事。
第三层是角色一致性与表演稳定性。全身图和四视图只能定义人物大致长相,角色在近景、哭喊、倒地和多人互动中仍可能出现面部、服装和肢体漂移。抬头、落泪、伸手等通用动作连续出现,也会让表演趋于模板化。
最后一层是直接可用性。用户仍要判断成片可以直接发布、需要局部修改,还是只能作为分镜参考。这个判断无法由“生成成功”自动推出。
从任务完成率转向首轮可用率
如果从产品指标看,Pavo 现在更接近在优化任务完成率,而用户真正关心的是首轮可用率。两个指标看似相近,实际会推动完全不同的产品设计。
任务完成率关注接口是否返回结果、步骤是否执行完毕;首轮可用率则要统计有多少镜头无需重做、多少对白无需修改、成片是否满足规格、用户导出后是否继续进入其他软件加工。前一个指标能说明系统稳定,后一个指标才接近产品价值。
让绿色进度条更有含金量
我更希望 Pavo 把状态拆成三层:已生成、已通过自动检查、待用户验收。比如系统可以在合成后直接提示:“目标 180 秒,当前 132.63 秒,时长偏差 26.3%”;检测主要角色在十二个镜头中的面部和服装一致性;标记口型或肢体稳定性风险较高的镜头;再让用户逐镜头确认、替换或锁定。这样,绿色进度条表达的就不只是系统做完了什么,也包括结果是否接近用户要的东西。
图 3:绿色进度条只说明任务返回结果;真正的交付还需要自动质检与人工验收。
五、被一键生成藏起来的成本
两轮测试实际用了多少积分
第一轮先充会员获得 1500 积分,因为不够用,又补入 750 积分;图片生成分别消耗 128、128、64 和 8 积分,两笔视频生成消耗 1044 和 774 积分,合计 2146 积分,本轮结束后剩余 104 积分。第二轮开始前又升级会员获得 4000 积分,随后剧情短片视频任务一次扣除 2016 积分,最终余额 2088。
一键生成背后的五类成本
这组数据让“成本”变得具体起来。AI 视频创作的总成本,至少可以拆成五部分:生成消耗、人工操作时间、模型等待时间、验收时间和返工消耗。
生成消耗最容易看见,因为积分会直接减少。人工操作时间在 Pavo 中确实被压缩了,用户不再手动维护几十条提示词和素材路径。模型等待时间虽然不一定需要盯着页面,却会影响任务排期。验收时间取决于镜头数量和质量标准;一条两分钟左右的视频,至少要完整观看一次,发现问题后还要定位到具体镜头。返工消耗最不稳定:如果一个镜头重做后带来人物变化,用户可能还要在局部质量和整体一致性之间重新选择。
可以把它写成一个并不复杂的公式:
总创作成本 = 积分或付费成本 + 人工操作成本 + 等待带来的排期成本 + 验收成本 + 返工成本
图 4:第一轮消耗 2146 积分,第二轮消耗 2016 积分,两轮合计 4162 积分。交易时间仅用于说明记录跨度。
Pavo 明显减少了公式中的第二项,后面三项仍然存在。更准确地说,它把用户从“生产者”推向了“审核者”。过去要亲手完成每个镜头,现在要从大量自动生成结果里判断哪些能留下。
这种成本转移并非 Pavo 独有,生成式产品从工具走向工作流时普遍会遇到它。自动化可以减少操作,同时也会增加对验收标准的依赖。没有标准,用户只能凭感觉反复抽卡;有了标准,用户又需要产品提供足够的信息和修复工具。
单次生成价格,不等于可用项目价格
第二轮测试进一步放大了这一点。为了验证稳定性和模型差异,用户又付出了 2016 积分;两轮累计 4162 积分。只要产品结果存在明显随机性,用户就会天然产生多轮生成需求。于是,单次生成价格无法代表完成一个可用项目的价格。更值得关注的指标应该是“每分钟可用成片消耗多少积分”,以及“得到一个可用镜头平均需要生成几次”。
让成本在生成前可见
如果 Pavo 能在任务开始前给出预计积分区间,在每个阶段显示实际消耗,并在重做前说明可能影响哪些后续资产,用户就能真正管理成本。否则,“一键生成”只是把复杂度藏到了按钮后面,账单和返工仍会在最后出现。
六、从产品经理视角看,Pavo 下一步需要补上验收系统
体验完两轮后,我认为 Pavo 的流程已经足够完整。它把小说改编成 AI 短剧所需的主要步骤都摆了出来。继续增加风格、模型或模板当然能扩展能力,但未必能解决用户最痛的地方。第二轮结果说明,用户需要的不只是“能够换模型”,还需要产品帮助自己选对模型、检查结果并修复问题。
先选对模型,再投入整片生成
第一项是模型选择与对比。当前的模型列表只解决了“有得选”,没有解释“为什么这样选”。Pavo 可以按人物一致性、构图与风格、动作与面部稳定等目标给出推荐,并允许用户用一张角色图或一个高风险镜头并行生成小样,再决定整部片子使用哪套模型。
把规格检查与内容风险拦截前置
第二项是硬性规格检查。时长、画幅、分辨率、音轨、字幕安全区等指标都有明确答案,完全可以自动判断。像本次 180 秒目标与 132.63 秒结果之间的偏差,不应该等用户下载后才发现。
第三项是内容风险提示。系统不必假装自己能替代导演,但可以识别马赛克、面部崩坏、异常肢体、亮度过低和血腥程度偏高等问题,也可以提前标记多人同框、剧烈动作、面部特写、连续对白和关键道具交互这些高风险镜头。第一轮分镜 2 和分镜 12 已经出现明显马赛克,却仍然进入视频生成和最终合成;如果在关键帧阶段自动拦截,后续积分和等待时间都可以省下来。
让镜头能衔接,也能局部返工
第四项是跨镜头连续性检查。第二轮已经证明,更强的视频模型能改善单个镜头的动作和面部稳定,却没有自动修好镜头之间的衔接。Pavo 需要记录上一个镜头的角色位置、视线、动作方向、环境状态和情绪,再把这些信息作为下一个镜头的约束;必要时自动生成过渡帧,或者提醒用户两个镜头之间缺少承接。转场不是最后加一个淡入淡出特效,它首先是叙事与动作的连续性。
第五项是局部修复能力。用户更需要锁定已经满意的人物、场景、声音和镜头,只重做存在问题的部分。局部重做后,产品还应检查新镜头与前后内容是否衔接。否则,修好一个动作却换了一张脸,返工就变成了新的问题来源。
让积分透明,让指标转向交付
第六项是成本透明。每个阶段预计消耗多少积分、已经花了多少、切换模型和重做会增加多少,应该在用户确认之前显示。对个人创作者来说,这是预算;对团队来说,这是排期和项目风险。
相应地,Pavo 的核心指标也可以从“生成了多少”转向“交付了多少”:首轮可用镜头率、规格一次通过率、每个可用镜头的平均重做次数、每分钟可用成片积分、从提交到第一版可编辑成片的时间,以及用户导出后是否仍需要进入剪辑软件大幅修改。
这些指标不一定好看,却能帮助产品从演示效果走向真实生产。AI 视频产品最容易展示的是一张惊艳关键帧,最难衡量的是一整条片子里有多少秒真的能用。Pavo 已经解决了“把步骤串起来”,下一阶段的竞争力取决于它能否把可用率也纳入产品闭环。
七、Pavo 现在适合谁,又不适合谁
从这两轮测试看,Pavo 很适合三类任务。
更适合形成第一版,而不是替代终稿
图 5:Pavo 适合快速形成第一版影像;严肃交付仍需预留验收、等待与返工预算。
第一类是小说、剧本和创意的快速视觉化。作者或策划可以用它验证人物关系、场景气质和故事是否适合影像表达。哪怕最终不直接发布,人物图、场景图、分镜和第一版成片也能帮助团队建立共同理解。
第二类是提案和预演。需要向客户、团队或投资人说明一个短剧概念时,一条有角色、有对白、有音乐的动态样片,比文字大纲更直观。此时的验收标准不是每一帧都完美,而是方向是否成立。
第三类是对精确控制要求不高的个人内容实验。用户愿意接受一定随机性,也愿意把生成结果当作素材而不是终稿,Pavo 能大幅减少跨工具操作。
严肃交付仍要预留人工兜底
但如果任务涉及付费交付、稳定连载、固定角色 IP、严格品牌规范、精确时长或复杂动作,当前结果还需要谨慎。用户至少要预留人工验收和后期修改时间,不能因为页面显示“全部成功”就直接把成片交出去。
另外,本次使用小说片段只是产品体验材料,不等于获得了作品的商业改编授权。任何公开发行或商业使用都需要单独处理版权问题。AI 降低了制作门槛,并不会自动消除内容权利边界。
Pavo 更像工作台,而不是万能生成器
两轮测试让我重新理解了 Pavo 的价值。第一轮默认模型的表现并不理想,换成 Seedream 5.0 lite 和 Seedance 2.0 Fast 后,角色、关键帧和动态镜头明显改善。这意味着 Pavo 的优势不能只建立在默认模型效果上。它更有潜力的方向,是成为一个能组织不同模型、保存中间资产并指导普通用户完成创作的工作台。
工作流不能抹平模型差距,却能把模型差距变成可管理的产品决策。用户无需离开项目、重传素材和重写提示词,就能换模型继续生产;如果再补上模型推荐、自动质检、连续性检查和局部修复,才可能从“生成一版看看”走向稳定生产。
真正的终点,是交付成功
所以,我对 Pavo 的评价既积极,也保留。它已经让原本停留在文字里的想法更快拥有第一版影像,也确实能指导没有经验的人走完需求、剧本、视觉设计和分镜;但这条生产线目前更擅长保证“每个工位都开工”,还不擅长保证“成品通过验收”。
当 AI 视频产品都能生成漂亮画面之后,下一轮竞争不会只是谁的按钮更少、默认模型更强,而是谁能把模型选择、过程控制和质量验收真正连成闭环。用户最终购买的不是一次生成成功,而是一次交付成功的概率。
参考资料
[1] Pavo - AI Image & Video Maker|App Store
[2] Agnes Image 2.1 Flash|Agnes AI Docs
[3] Agnes Video V2.0|Agnes AI Docs
[4] “使用 Agnes 自研模型”相关报道|新浪科技转载 IT之家
[5] Doubao Seedream 系列图片生成|火山引擎文档
[6] Doubao Seedance 2.0 Fast 快速入门|火山引擎文档