Wan 3.0 AI 视频生成器
Wan 3.0 是阿里巴巴的视频生成模型,可把创意和参考资料用于视频创作。在 China AI,你可以从文字、图片、视频或音频参考出发,也可以上传文档或提供网页作为参考。视频最长 30 秒,最高输出 1080p。
Wan 3.0 能用来做什么
开始做视频时,你手里未必已经有一段完整的提示词,更可能是一份产品资料、一套演示文档、一个网页或几张图片。Wan 3.0 让这些素材参与创作,同时保留常见的文生视频和图生视频控制方式。
| 能力 | China AI 支持范围 |
|---|---|
| 视频时长 | 2–30 秒;参考视频与生成视频合计不超过 30 秒 |
| 输出分辨率 | 480p、720p、1080p |
| 图片控制 | 首帧、首尾帧或参考图片 |
| 媒体参考 | 最多 10 张图片、5 段视频、5 段音频 |
| 资料参考 | 每次一份文档或一个网页 |
| 生成音频 | 可开启或关闭 |
先选包含关键信息的素材:首帧适合交代开场构图,产品文档适合说明要讲什么。它们解决的是不同问题,不必同时追求所有输入方式。
本页导航:文档与网页 · 图生视频 · 时长规则 · 模型比较
用文档或网页资料辅助生成视频
已有产品资料,不必从空白提示词开始
把产品文档或网页作为参考,再说明想做的视频:给谁看,主要讲哪个卖点,画面按什么顺序展开,最后停在哪里。一条视频先讲清一件事,让资料为创意提供依据,而不是把整份文件的内容都塞进去。
使用 PDF 或 PowerPoint 时,指出要参考的章节或观点。一套演示文档可能同时包含公司介绍、技术参数和多款产品;短片更适合集中解释其中一个主题,而不是试图把所有信息压缩成几秒钟。
使用网页时,选择可公开访问、包含相关内容的页面,并说明要做产品介绍、视觉摘要,还是从页面内容获得场景灵感。链接提供背景,创作方向仍需要你来确定。
文档、网页和首尾帧要分清用法
China AI 每次接受一份文档或一个网页,不能同时提交两者;文档、网页参考也不能与首尾帧组合。如果固定开场画面比文字资料更重要,应改用帧输入。
Wan 3.0 的文档生视频,更适合理解为“依据资料再创作”。生成后核对名称、数字、产品细节和画面文字。需要原样保留的说明或品牌字体,在剪辑时添加更合适。
图生视频:首帧和尾帧怎么用
产品照片、环境图或已经安排好的构图,都可以作为 Wan 3.0 图生视频的起点。提示词重点描述画面接下来怎么动,不必重新列一遍图片里已有的物体。
如果结尾必须落在特定画面,可以添加尾帧,例如产品展示最终停在特写,或镜头移动后落到指定视角。首尾画面要能通过合理动作衔接;主体或布局变化太大,模型就需要自行补出更多过渡过程。
参考图片的作用不同:它用来引导主体外观,而不占用专门的首尾帧位置。在 China AI,参考图片不能与首尾帧在同一次请求中混用。打开图生视频,选择 Wan 3.0,再按镜头需求选择输入方式。
参考视频会占用多少生成时长
没有参考视频时,输出可选 2–30 秒;加入参考视频后,它的时长也计入同一个 30 秒上限。
| 参考视频总时长 | 最长生成时长 |
|---|---|
| 无参考视频 | 30 秒 |
| 5 秒 | 25 秒 |
| 10 秒 | 20 秒 |
| 15 秒 | 15 秒 |
参考视频本身最多上传 5 段,合计不超过 15 秒。增加文件数量不会增加时长额度。参考音频也有独立的 15 秒总输入上限。
只保留真正有用的动作或画面片段,既能让参考更明确,也能给新视频留出更多时间。如果必须输出完整 30 秒,应从文字、图片或其他支持的非视频素材开始。
参数可以先按用途来定:竖版选 9:16,横版演示选 16:9,其他用途选对应的可用比例。用 480p 或 720p 探索画面,需要更高清版本时再选 1080p。同时决定是否生成音频,或留到后期单独配音配乐。
产品介绍、知识讲解和社交视频怎么做
用产品资料做一段介绍视频
选一份产品文档或一个公开产品页,只抓一个主要卖点。可以先从使用情境讲起,再让产品出场,最后落到完整展示。第一版做 15–20 秒,先检查这条线是否讲得清楚,再考虑增加内容。
说明哪些产品特征必须可辨认,并在输出后检查。如果产品的第一眼展示比书面信息更重要,改用产品图和帧输入。标志、包装文字等精确内容,另备素材以便后期添加。
从演示文档里挑一个概念做讲解
不要一开始就要求把整套幻灯片变成视频。先选一个概念,按“提出问题—画面解释—得出结论”组织。放进演示文稿时可用横版,面向手机观看时可用竖版。
文档参考帮助确定主题,但密集图表和小字数字要格外留意。需要精确展示的图表,后期使用原图;生成视频负责围绕它补充更直观的场景说明。
从活动网页延伸出社交短片
提供活动或目的地网页作为背景,再给出明确角度:开头用什么画面吸引注意,中间呈现哪种体验或好处,最后停在哪里。先尝试 10–15 秒的竖版方案,确实需要更多铺垫时再延长。
把要求写成能看见的画面,不只说“做成爆款”。例如先确定第一个镜头里出现什么、结尾前发生什么变化,这样生成后才有具体的判断依据。
Wan 3.0 和旧版 Wan 有什么区别
这次变化不只是片段更长,也包括创作起点更丰富。阿里巴巴的 Wan 3.0 介绍在文字、图片、视频和音频之外,加入了文档与网页参考,输出最长达到 30 秒。Wan 系列中还有 2.7;China AI 仍提供的 Wan 2.6 是较早版本,并非 3.0 的直接上一代。
| China AI 上的选择项 | Wan 2.6 | Wan 3.0 |
|---|---|---|
| 输出时长 | 5、10 或 15 秒 | 2–30 秒,受参考视频合并时长规则限制 |
| 分辨率 | 720p、1080p | 480p、720p、1080p |
| 文档或网页参考 | Wan 2.6 工作流不提供 | 支持 |
| 起止构图 | 图生视频输入 | 专门的首尾帧控制 |
已有短视频流程用 Wan 2.6 就能满足需求,可以继续保留。需要文档、网页、首尾帧控制或更长输出时,再选 Wan 3.0。
Wan 3.0 和 Seedance 2.5 怎么选
创作材料主要是文档或网页,优先考虑 Wan 3.0;项目需要更大的图片、视频和音频参考集,可考虑 Seedance 2.5。两者在 China AI 都支持最高 1080p,仅看分辨率不足以区分。
| 你的起步需求 | 可考虑的模型 |
|---|---|
| 产品信息在 PDF、演示文档或网页中 | Wan 3.0 |
| 片段短于 4 秒 | Wan 3.0 |
| 某一类参考素材数量超过 Wan 的容量 | Seedance 2.5 |
| 需要 4K,并逐个镜头安排内容 | 可灵 Kling 3.0 |
Seedance 2.5 指南介绍了如何给更多参考素材分配用途。需要 4K 和多镜头控制,可以看可灵 Kling 3.0;想同时比较图像与视频模型,可以看国产 AI 模型盘点。
Wan 3.0 的限制与应对方法
标注最长 30 秒,不代表每次都能输出 30 秒。 参考视频会占用共同的时长额度,提交前先截短参考,或缩短新片段。
上传资料不能替代创作方向。 长文档往往包含多个主题,先确定要传达的观点和画面顺序,不要只依赖上传的文件。
音频和画面文字需要检查。 阿里巴巴将音频质感、文字渲染准确性列为仍在改进的方面。生成后听一遍声音,检查文字细节;重要标题、数字和品牌元素,必要时在剪辑软件中替换。
这里最高输出 1080p。 交付要求原生 4K 时,应选择有 4K 选项的模型。提示词写得更长、更细,并不会改变分辨率设置。
在 China AI 上使用 Wan 3.0
Frequently Asked Questions
继续比较视频模型
Seedance 2.5 AI 视频生成器
在 China AI 使用 Seedance 2.5,从文字、首尾帧或图片、视频、音频参考生成 4–30 秒视频,支持 480p、720p、1080p。了解输入模式、提示词思路,以及和 Seedance 2、Wan 3、可灵的区别。
可灵 3.0 怎么用、和即梦怎么选:4K 与智能分镜
可灵 3.0(Kling)是快手的国产 AI 视频模型,4K 模式 + 智能分镜,最长 15 秒。讲清它怎么用、和即梦 Seedance 怎么选、有哪些坑。
国产 AI 视频生成器怎么选:可灵、即梦与通义万相
国产 AI 视频模型怎么选?在 China AI 比较 Seedance 2.5、可灵 Kling 3.0、通义万相 Wan 3.0 等,按时长、分辨率和参考输入选择。