一次讲完最长 30 秒的故事
可选择 2 到 30 秒之间的整数时长,也可以让智能时长根据提示词自动决定。镜头更长,动作、运镜和对白就更有时间自然结束。
用清晰的提示词、参考素材和输出设置规划 Wan 3.0 视频,并先用 Nana Banana 当前可用的模型生成草稿。
暂无预览
在左侧调整设置并开始生成,即可在这里查看结果。

当前模型为 Veo 3.1 Fast 和 Veo 3.1。Nana Banana 完成接入后,Wan 3.0 才会出现在模型列表中。
Wan 3.0 官方案例
以下视频由阿里云作为 Wan 3.0 案例发布,现由 Nana Banana CDN 提供网页优化版本;内容来自官方,不是 Nana Banana 生成的结果。
官方案例 · 720P · 30 秒
用两张参考图固定狸花猫和灰狼角色,在高速动作与镜头变化中保持毛发、服饰和空间关系一致。
官方案例 · 720P · 24 秒
三张参考图固定两名角色和道场空间,同时完成人物动作、日语对白与音画同步。
官方案例 · 720P · 25 秒
模型读取品牌文档中的故事、原料和空间信息,再根据一句创作方向生成完整的咖啡馆广告。
Wan 3.0 能力
Wan 3.0 把提示词、参考素材、文档和原生音频整合到同一套视频工作流中。
可选择 2 到 30 秒之间的整数时长,也可以让智能时长根据提示词自动决定。镜头更长,动作、运镜和对白就更有时间自然结束。
Wan 3.0 能理解文字、图片、视频、音频、办公文件和公开网页。比如,一份演示文稿或报告也可以成为视频的起点。
音频默认开启。模型会在生成画面的同时处理人声、音乐和环境声,让说话、动作与声音更容易对上。
最多可加入 10 张图片、5 段短视频和 5 段短音频,用来固定人物、产品、场景、风格或声音。
只传第一帧,可以规定视频怎么开始;同时传第一帧和最后一帧,还能引导动作最后停在哪里。
阿里云介绍称,Wan 3.0 能修改已有结果中的画面、剧情或对白。发现某一处不对时,不一定要把整个创意从头生成。
官方规格
根据官方限制选择合适的时长、参考素材、画面比例和输出画质。
提示词流程
按顺序描述场景,只添加真正有用的参考素材,并根据发布平台选择输出设置。
写明谁或什么东西出现、发生什么、镜头怎样移动、光线是什么样,以及应该听到什么。按时间顺序写动作。
图片用来固定外观,短视频用来说明动作,音频用来参考声音。在提示词中点名每个素材,让模型知道它们各自负责什么。
时长要够动作完成;横屏或竖屏要符合发布平台;先用低分辨率做草稿,确定方向后再生成 1080P 成片。
模型接入
Wan 3.0 已可在阿里云百炼使用,但尚未出现在 Nana Banana 的模型列表中。
Wan 3.0 已在百炼提供,模型 ID 为 wan3.0-video。API 密钥、接口地址和模型需要位于同一地域。
Wan 3.0 尚未接入本站。模型连接、积分价格和生成流程完成测试后,它才会出现在模型列表中。
使用上方的 Veo 3.1 Fast 或 Veo 3.1 测试提示词、构图和节奏。
Wan 3.0 信息最近核对时间: 2026年8月29日
官方资料
查看本页采用的阿里云模型发布页、产品介绍和 API 文档。
了解模型、接入方式、价格、输入和输出。
Wan 3.0 是阿里巴巴最新一代全能 AI 视频模型。它能根据文字或参考素材生成视频,一次任务最长可得到 30 秒的画面与声音。
还不能。上方生成器当前使用 Veo 3.1 Fast 或 Veo 3.1。Nana Banana 完成接入和测试后,Wan 3.0 才会出现在模型列表中。
官方 API 按输出秒数收费。最近核对时,阿里云标价为 480P 每秒 0.05 美元、720P 每秒 0.10 美元、1080P 每秒 0.20 美元。本站会为当前可用模型提供注册额度。
没有视频输入时,可以选择 2 到 30 秒之间的整数,也能让智能时长自动决定。若输入视频,输入与输出总时长必须控制在 30 秒内。
会。音频默认开启,Wan 3.0 可以让对白、人声、音乐和环境声与画面一起生成,也可以手动关闭音频。
API 接受文字、图片、短视频、短音频、一个文档或一个公开网页,还支持用第一帧或第一帧加最后一帧控制画面。
官方 API 提供 480P、720P 和 1080P,并支持横屏、方形、竖屏和自适应画幅。
阿里巴巴官方资料将 Wan 3.0 描述为云端模型和 API,没有公布可下载的 Wan 3.0 开源权重。旧版 Wan 有开源仓库,但不能因此把 Wan 3.0 也当成开源模型。