Wan 3.0开启公测:30秒视频与文档参考能力实测
Wan 3.0开启公测,单次最长生成30秒视频,并支持文档、表格、网页、图片、音频和视频等多类型参考素材。它的变化不只在画面质量,也在于把长镜头叙事、角色一致性和内容生产流程放进同一套云端工具中。
AI 视频产品的竞争,正在从“能不能生成一张漂亮的画面”,转向“能不能把一段内容完整地做出来”。
此前,用户常见的工作方式是先写提示词,生成几秒钟的视频片段,再把多个片段拼接起来。人物可能在第二个镜头里换了脸,衣服颜色发生变化,手里的道具消失,镜头运动也难以衔接。到了后期,剪辑、补帧、配音和重生成往往比最初的提示词更耗时间。
Wan 3.0 的公测,试图处理的正是这类问题。它支持单次生成最长 30 秒的视频,还可以读取 Word、PPT、PDF、Excel、TXT、Markdown 和网页链接等资料,并将文字、图片、音频、视频放进同一个创作任务中。
这让视频生成不再只围绕一条提示词展开。产品资料、课程文档、品牌页面、小说内容,甚至一组人物参考图,都可以成为视频的输入。
30 秒视频,改变了什么
单次生成最长 30 秒,首先减少了“分段生成”的次数。
假设要制作一条 30 秒的产品广告。传统的 AI 视频流程可能是:
- 生成产品特写;
- 生成用户拿起产品的动作;
- 生成走出商店的中景;
- 生成街道和广告牌;
- 将所有片段剪辑在一起;
- 重新处理人物、光线和运动方向。
每多生成一个片段,就多一次人物和场景发生变化的机会。镜头之间还要考虑动作是否接得上、主体位置是否合理、音乐节奏是否匹配。
如果模型能够一次生成完整的连续镜头,后期需要处理的接缝会少很多。它不一定替代剪辑,但能把剪辑从“抢救素材”变成“调整节奏”。
公开展示的一个样片,是镜头从购物车开始,持续追踪人物和道路,最后延伸到街道上的广告牌。整个过程大约 30 秒,镜头没有简单地停留在同一个画面里,而是包含主体移动、视角变化和空间推进。视频转录中的实测时长约为 30.1 秒。
这类镜头的难点不在于某一帧是否精致,而在于前后画面能否形成一条连续的视觉路径。购物车、道路、人物和广告牌之间要有明确的空间关系,镜头还要持续移动。如果每两三秒就出现一次场景跳变,30 秒只会变成一串互不相关的片段。
Wan 3.0 还强调推镜、跟拍、镜头切换和蒙太奇叙事等镜头语言。对于广告和短剧来说,运镜不是装饰。推近可以突出人物表情,跟拍可以交代行动方向,切换镜头则能把两个空间或两条情节线连接起来。
动作场景也能看出模型的连续性能力。公开实测中出现了高速近身舞打、反击、转身和闪避等动作。人物身体的受力、动作顺序和镜头调度相对自然,不再只是把几个姿势快速串在一起。
不过,30 秒成片和 30 秒稳定输出是两件事。
目前公开素材主要展示了官方样片和个别测试案例,没有统一公开每个案例使用的提示词、随机种子、生成次数、失败率以及后期处理过程。因此,不能根据一个效果较好的样片,直接推断所有用户都能一次生成同等质量的 30 秒视频。
更合理的判断方式,是把“最长 30 秒”看作能力上限,再观察不同任务下的稳定性。
| 观察项目 | Wan 3.0 公测信息 | 仍需验证的部分 |
|---|---|---|
| 单次时长 | 最长 30 秒 | 不同分辨率和任务是否都能稳定达到 |
| 镜头表达 | 支持推镜、跟拍、切换等效果 | 复杂运镜下的主体稳定性 |
| 动作生成 | 展示了舞打、闪避、反击等场景 | 多人物碰撞和连续动作的失败率 |
| 长镜头叙事 | 可用于一镜到底和连续表达 | 多次生成时的质量波动 |
| 后期工作量 | 有望减少片段拼接 | 仍需实际项目验证 |
全能参考:让原始资料直接进入视频流程
Wan 3.0 更有区分度的能力,可能不是 30 秒,而是“全能参考”。
普通的视频生成工具通常要求用户把需求整理成几句提示词,或者上传一张图片。Wan 3.0 支持的输入范围更广,包括:
- 文字;
- 图片;
- 音频;
- 视频;
- Word 文档;
- PPT 演示文稿;
- PDF;
- Excel 表格;
- TXT 和 Markdown 文件;
- 网页链接。
产品资料、网页内容和办公文档,过去通常需要人工先整理一遍,提炼出标题、卖点、人物关系和镜头脚本,再交给模型生成视频。现在,模型可以直接读取这些资料,并尝试从中提取内容。
公开信息显示,Wan 3.0 最多可以接入 20 份参考资产。对于企业内容团队来说,这个数量意味着一次任务可以放入品牌手册、产品说明书、价格表、网页介绍和人物素材,而不必把每份资料分别处理。
举个具体场景。
一家企业要制作一条新产品介绍视频。资料可能包括一份 PDF 产品手册、一份 Excel 参数表、官网产品页面、几张产品图,以及一段销售人员录音。以前,创作者需要自己核对这些信息,把参数改写成旁白,再设计画面。现在可以让模型先从资料中提取产品名称、功能和关键参数,再组织出产品演示视频。
这不意味着模型可以自动解决所有事实错误。涉及价格、规格、售后政策等内容时,仍然需要人工核对。文档接入减少的是整理成本,不是审核责任。
公开实测中,网页内容被用来生成安史之乱主题的科普动画。人物照片和 Word 文档结合后,生成了第一人称 Vlog。小说内容则被转化为带有台词、人物关系和剧情推进的短剧。
这几类任务分别对应三种常见需求:
| 输入内容 | 可能生成的结果 | 适用场景 |
|---|---|---|
| 网页、百科或课程材料 | 科普动画、知识讲解视频 | 教育、知识传播、社交媒体 |
| 人物照片加文档 | 第一人称 Vlog、人物介绍 | 品牌宣传、个人账号、活动记录 |
| 小说或故事文本 | 带台词的短剧、剧情片段 | 短剧、影视分镜、故事预演 |
| PPT、PDF、Excel | 产品演示、动态图表、汇报视频 | 企业培训、销售演示、业务汇报 |
| 产品图、品牌手册和网页 | 广告片、宣传片、社媒短视频 | 广告、电商、品牌营销 |
文档转视频的意义,在于它把“素材准备”和“视频生成”拉得更近。创作者不需要先把资料拆成几十张图片,也不必把所有背景信息压缩成一段提示词。
千问创作还加入了 Agent Team 模式。根据公开介绍,系统可以让编剧、导演、美术等多个 AI 角色协同工作,分别推进故事策划、视觉设定和成片生成。
这样的模式更接近一个小型制作流程。编剧负责故事和台词,导演处理镜头顺序,美术确定人物、场景和风格。最终效果是否稳定,还要看这些角色之间的信息能不能准确传递,但方向已经从“输入一句提示词,等待一段视频”,转向“围绕一个任务组织多个生产步骤”。
角色一致性,决定长视频能不能看下去
生成视频时,单帧好看并不难。难的是让同一个人物在 30 秒里始终像同一个人,让他的衣服、道具、动作和所处空间保持合理关系。
Wan 3.0 将人物真实感作为升级重点,涉及五官、皮肤细节、表情、肢体动作和情绪表达。在群像场景中,模型还需要区分不同人物的表情和情绪,避免所有人都呈现同一张脸、同一种反应。
全能参考任务中的一致性,主要体现在几个方面:
- 角色外貌是否稳定;
- 服装和配饰是否持续存在;
- 手中的道具是否发生无缘无故的变化;
- 人物与场景的空间关系是否连贯;
- 视频整体的视觉风格是否统一;
- 剧情推进是否符合前后逻辑。
公开测试中的“霸道总裁”对话案例,人物形象、空间关系和剧情推进保持相对稳定,台词表达也比较连贯。对于短剧而言,这比某个镜头中的皮肤纹理更重要。观众首先要看懂谁在说话、谁与谁发生关系,以及情节接下来如何发展。
另一个废土故事案例中,机器人穿过废弃城市,进入实验室,随后走向高台。这个过程涉及多个空间和连续动作。机器人形象、城市环境与故事线在较长流程中保持了相对稳定。
模型也在降低视觉创作的表达门槛。简单的自然语言描述,例如把草莓转化为一座 V 型城市,或者让古装人物在雪地中回头,都可以生成较完整的视觉设定。普通用户不需要先掌握复杂的镜头术语,便能开始尝试。
但一致性不是“任何条件下都不会出错”。
对比素材中,人物从白天环境进入夜间场景后,脸部光线仍然偏向白天,脸部主体亮度与周围环境没有完全融合。人物的轮廓可能保持住了,光照逻辑却没有跟上。
这暴露出长视频生成中的一个常见问题:模型可以维持“这个人是谁”,却未必能同时维持“这个人此刻处于什么光线里”。
复杂场景中还需要继续观察:
- 人物从室内走到室外时,曝光是否自然变化;
- 同一人物在逆光、侧光和霓虹灯下是否保持稳定;
- 多人交谈时,视线和身体朝向是否准确;
- 人物互相遮挡、交接物品时,手部是否出现错误;
- 角色经过多个场景后,服装和道具是否仍然一致。
这些细节决定了视频能否直接交付。一个概念片可以容忍局部瑕疵,企业广告、课程内容和连续短剧则通常不行。
公测渠道与价格:先分清计费口径
公开信息显示,Wan 3.0 已在千问创作上线体验,并通过阿里云百炼、万镜一刻、万相官网和千问创作 PC 端开放公测,千问 App 则采取灰度开放方式。
不同入口可能对应不同的功能范围和计费方式。API、网页端创作工具和 App 内体验,不能默认使用同一套价格。
现有素材中的价格信息存在两组口径。
一篇产品信息将 API 价格列为:
| 分辨率 | 单价 |
|---|---|
| 480P | 0.3 元/秒 |
| 720P | 0.6 元/秒 |
| 1080P | 1.2 元/秒 |
按照这组价格计算,生成 30 秒 1080P 视频的理论输出费用为:
1.2 元/秒 × 30 秒 = 36 元
另一段视频转录记录的则是美元计价,每秒分别为 0.05 美元、0.10 美元和 0.20 美元。按该口径计算,30 秒视频对应 1.5 美元、3 美元和 6 美元。
两组数字可能来自不同渠道、不同时间版本,或者包含不同的计费条件。它们不能直接合并为一份最终价目表。公测额度、输入素材是否收费、失败任务是否计费、不同入口是否采用不同价格,都应以当前平台页面和正式账单规则为准。
对于团队来说,真正需要核算的不是单条成片价格,而是“交付一条可用视频需要生成多少次”。
例如,一条 30 秒广告如果需要生成 5 次,才能得到一版可交付结果,那么理论输出费用就要乘以 5,还要加上配音、剪辑、人工审核和素材整理成本。视频生成模型的单价很低,并不代表完整生产成本一定低。
云端工具和本地模型,适合不同的人
Wan 3.0 更像一个完整的云端生产入口。用户可以直接上传资料、调用多种参考类型,生成最长 30 秒的视频,适合希望快速试错和交付的广告、企业内容及短视频团队。
素材中还将 Wan 3.0 与 MiniMax H3-Base 做了路线对照。H3-Base 已开放部分权重,可以支持本地生成、ComfyUI 工作流以及进一步微调。但 Context IR、2K 重生成模块等完整系统能力并未全部开放,同时还受到 Community License 的地区和商业使用限制。
这不是一次模型性能排名。两者公开案例没有使用相同素材、提示词和参数,无法据此判断谁的画面质量更高。它们更像两种不同的产品选择:
| 选择方向 | Wan 3.0 | MiniMax H3-Base |
|---|---|---|
| 使用方式 | 云端平台和 API | 本地部署及开发者工作流 |
| 上手门槛 | 较低,适合直接创作 | 需要算力、环境和技术配置 |
| 资料输入 | 文档、网页及多模态参考 | 取决于开放权重和工具链 |
| 可控性 | 依赖平台提供的功能 | 可通过工作流和微调增强 |
| 适合用户 | 内容团队、广告和企业用户 | 开发者、研究者和定制项目 |
| 主要关注点 | 交付效率和平台成本 | 算力成本、许可证和维护成本 |
如果目标是尽快制作一批产品视频,云端工具的便利性更重要。如果需要把模型部署到内部环境,保护资料隐私,或者针对固定角色和风格进行微调,本地方案的控制权更有价值。
选择模型时,至少要同时核对四件事:生成成本、资料能否上传、商业授权范围,以及失败后是否可以稳定重试。只看一段样片,无法回答这些问题。
Wan 3.0 目前适合做什么
结合已经展示的功能,Wan 3.0 的应用范围已经超过单个视觉镜头。
短剧团队可以用小说、人物图和场景资料生成剧情片段,先验证人物关系和镜头节奏,再决定是否投入真人拍摄或更复杂的制作。
广告团队可以把产品手册、品牌页面、产品图片和宣传文案放入同一项任务,生成多个版本的产品展示视频。它尤其适合电商内容和社交媒体短片,因为这些内容通常需要高频更新,且单条视频时长不长。
企业培训部门可以把 PPT、PDF 和课程文档转成带旁白、动态图表和场景演示的视频。销售团队则可以用产品参数表和网页资料制作不同客户版本的介绍视频。
知识创作者可以从网页、文章或课程材料开始,生成科普动画和讲解片。此时人工审核尤其重要,模型能组织画面和叙事,不代表它会自动判断资料中的每个事实是否准确。
这些场景有一个共同点:视频不是孤立的艺术画面,而是资料、人物、叙事和交付格式共同组成的内容产品。Wan 3.0 的优势,正是在一次任务中承接更多输入,并尽量把这些输入连接成连续视频。
接下来要看哪些数据
Wan 3.0 公测最值得观察的,不是官方样片还能多漂亮,而是同一套素材重复生成时,结果能否保持稳定。
后续测试可以围绕以下指标展开:
- 同一提示词连续生成多次,人物和场景的变化幅度有多大;
- 30 秒视频中,前 10 秒和后 20 秒的角色一致性是否下降;
- 夜景、逆光、室内外切换等复杂光照下,人物是否能与环境融合;
- 两人以上对话、动作碰撞和物品交接是否容易出错;
- 文档中的表格、参数和专有名词能否准确进入旁白与画面;
- 视频延长功能是否能自然接续原片,而不是出现新的场景和人物;
- 一条可交付视频平均需要生成多少次;
- 公测额度、输入费用和失败任务是否计费。
这些数据比“某个镜头看起来很震撼”更能说明工具的生产价值。
Wan 3.0 的公测重点可以概括为三项:单次最长 30 秒的连续视频生成,多类型参考素材尤其是办公文档和网页的直接接入,以及人物、动作、场景和剧情一致性的提升。
它把视频生成从单镜头实验,推向短剧、广告、品牌宣传、知识科普、产品演示和企业汇报等更完整的内容流程。至于稳定性、实际成本,以及它与其他模型之间的性能差距,仍应等待更多统一条件下的公开测试。