一次讲完最长 30 秒的故事
可选择 2 到 30 秒之间的整数时长,也可以让智能时长根据提示词自动决定。镜头更长,动作、运镜和对白就更有时间自然结束。
用提示词、首尾帧,或参考图片、视频与音频直接生成 Wan 3.0 视频。可选 480P、720P、1080P,提交前会显示所需积分。
暂无预览
在左侧调整设置并开始生成,即可在这里查看结果。

Wan 3.0 已上线。选择文字、首尾帧或参考模式;默认画质为 720P,生成前会显示准确的 Nana Banana 积分价格。
Wan 3.0 官方案例
以下视频由阿里云作为 Wan 3.0 案例发布,现由 Nana Banana CDN 提供网页优化版本;内容来自官方,不是 Nana Banana 生成的结果。
官方案例 · 720P · 30 秒
用两张参考图固定狸花猫和灰狼角色,在高速动作与镜头变化中保持毛发、服饰和空间关系一致。
官方案例 · 720P · 24 秒
三张参考图固定两名角色和道场空间,同时完成人物动作、日语对白与音画同步。
官方案例 · 720P · 25 秒
模型读取品牌文档中的故事、原料和空间信息,再根据一句创作方向生成完整的咖啡馆广告。
Wan 3.0 能力
Wan 3.0 把提示词、参考素材、文档和原生音频整合到同一套视频工作流中。
可选择 2 到 30 秒之间的整数时长,也可以让智能时长根据提示词自动决定。镜头更长,动作、运镜和对白就更有时间自然结束。
Wan 3.0 能理解文字、图片、视频、音频、办公文件和公开网页。比如,一份演示文稿或报告也可以成为视频的起点。
音频默认开启。模型会在生成画面的同时处理人声、音乐和环境声,让说话、动作与声音更容易对上。
最多可加入 10 张图片、5 段短视频和 5 段短音频,用来固定人物、产品、场景、风格或声音。
只传第一帧,可以规定视频怎么开始;同时传第一帧和最后一帧,还能引导动作最后停在哪里。
纯提示词选择文字模式;需要严格控制第一帧和最后一帧时选择首尾帧模式;图片、视频和音频参考则选择参考模式。输入与模式对应,能减少请求被拒绝的情况。
官方规格
根据官方限制选择合适的时长、参考素材、画面比例和输出画质。
提示词流程
按顺序描述场景,只添加真正有用的参考素材,并根据发布平台选择输出设置。
写明谁或什么东西出现、发生什么、镜头怎样移动、光线是什么样,以及应该听到什么。按时间顺序写动作。
图片用来固定外观,短视频用来说明动作,音频用来参考声音。在提示词中点名每个素材,让模型知道它们各自负责什么。
时长要够动作完成;横屏或竖屏要符合发布平台;先用低分辨率做草稿,确定方向后再生成 1080P 成片。
模型接入
Wan 3.0 已通过 EvoLink 正式 API 接入 Nana Banana 视频生成器。
上方生成器支持 Wan 3.0 文生视频、首尾帧生视频,以及图片、视频和音频参考生视频。
Wan 3.0 按当前 EvoLink 上游成本的 1.5 倍定价,再换算成整数 Nana Banana 积分;提交前就能看到总价。
EvoLink 的结果链接会过期,因此 Nana Banana 会先把成功生成的视频复制到自己的存储,再展示到你的作品中。
Wan 3.0 信息最近核对时间: 2026年8月26日
官方资料
查看本页采用的官方模型资料,以及本站实际接入所依据的 EvoLink API 与价格信息。
了解模型、接入方式、价格、输入和输出。
Wan 3.0 是阿里巴巴最新一代全能 AI 视频模型。它能根据文字或参考素材生成视频,一次任务最长可得到 30 秒的画面与声音。
可以。请在上方选择 Wan 3.0,再选择文字、首尾帧或参考模式。Nana Banana 会处理 EvoLink 任务并保存完成的视频。
新用户可以使用可用的注册积分试用。每次生成会根据时长和分辨率扣除积分;Nana Banana 按当前 EvoLink 上游成本的 1.5 倍定价,并在生成前显示总价。
没有视频输入时,可以选择 2 到 30 秒之间的整数,也能让智能时长自动决定。若输入视频,输入与输出总时长必须控制在 30 秒内。
会。音频默认开启,Wan 3.0 可以让对白、人声、音乐和环境声与画面一起生成,也可以手动关闭音频。
API 接受文字、图片、短视频、短音频、一个文档或一个公开网页,还支持用第一帧或第一帧加最后一帧控制画面。
官方 API 提供 480P、720P 和 1080P,并支持横屏、方形、竖屏和自适应画幅。
阿里巴巴官方资料将 Wan 3.0 描述为云端模型和 API,没有公布可下载的 Wan 3.0 开源权重。旧版 Wan 有开源仓库,但不能因此把 Wan 3.0 也当成开源模型。
写下提示词,选择模式和输出设置,然后直接使用 Wan 3.0 生成视频。