Bananai

Trình tạo video AI Wan 3.0

模型概述

什么是 Wan 3.0

全能型 AI 视频模型,助力更长叙事、丰富参考图及完整视听创作

Wan 3.0 是阿里巴巴 Wan 团队推出的新型全能视频生成模型,专为希望从创意快速过渡到连贯视听草稿的创作者而设计。模型将文生视频、图生视频、首尾帧控制、参考媒体及基于文件的创作整合到单一工作流中。你可以根据文本规划场景,用图像固定构图,用参考媒体引导形象,或提供文档及网页链接作为创作素材。Wan 3.0 单次最高可生成 30 秒视频,并支持原生音频输出。对于营销人员、电影制作人、教育工作者、产品团队及社媒创作者,其实用价值在于提供更宽泛的创作起点:带上现有素材,描述所需效果,让模型将其塑造为视听概念。Bananai 接入即将推出;在此之前,上方生成器保持 Wan 3.0 可见,同时选择 Wan 2.7 生成标识清晰的工作草稿。

Wan 3.0 多模态视频工作流,融合文档、图像、视频、音频及网页参考
Wan 3.0 单次生成可创作长达 30 秒的视频。
Wan 3.0 支持文本、图像、视频、音频、文件及网页链接输入。
Wan 3.0 可生成带有原生音轨的视频。
核心能力

Wan 3.0 拓展创作工作流的三大方式

Wan 3.0 围绕实际生产输入设计,而非仅依赖提示词撰写。从更长的故事开始,转换现有素材,或使用参考媒体使结果符合你的预期。

01

使用 Wan 3.0 创作更长的故事

构建长达 30 秒的视频,无需拼接多段不相关的短生成片段。为 Wan 3.0 提供清晰的开端、集中的动作序列及深思熟虑的结尾。更长的生成窗口为产品演示、教程、视觉叙事及活动场景留出更多发展空间,同时保持单次请求内的创意方向连贯。

Wan 3.0 在长电影序列中保持一致的角色形象
02

将文件和网页转换为 Wan 3.0 视频简报

使用演示文稿、文档、表格、PDF、纯文本文件或网页链接作为源素材。Wan 3.0 可以读取提供的素材并结合你的提示词,塑造产品宣传片、讲解视频、活动概念或视觉摘要。这种工作流帮助你基于经过批准的信息开始创作,而无需将每个细节重写为短提示词。

Wan 3.0 将演示文稿、文档、表格和网页素材转换为产品视频
03

借助 Wan 3.0 引导一致的声画表现

结合视觉参考、运动参考及音频指导,使模型不仅理解文字场景描述。Wan 3.0 旨在保留可识别的主体、支持富有表现力的角色并生成匹配的声音。当人物、产品、环境或声学氛围必须与现有创意资产保持一致时,参考驱动创作非常有用。

Wan 3.0 使用一致的角色、产品、运动和音频参考生成单个电影级结果
创作工作流

选择适合你的 Wan 3.0 创作起点

Wan 3.0 支持多种起始方式。选择与你现有素材及项目所需控制程度相匹配的工作流。

Wan 3.0 文生视频

当你需要原创场景时,从文字创意开始。描述主体、场景、时间顺序动作、镜头运动、光照、视觉风格及声音。Wan 3.0 能将完整的方向转化为视频,而非单一的静态构图。

非常适合概念片、社交吸引点、活动创意、建立镜头及原创视觉叙事。

Wan 3.0 图生视频

上传起始图像以锁定构图、形象、产品形状或美术方向。在最终状态至关重要时添加可选的结尾帧。告诉 Wan 3.0 什么应该运动、什么必须保持稳定以及镜头如何运镜。

非常适合产品动画、人像动态、海报动画、视觉活动及受控过度。

Wan 3.0 参考图与文件创作

将图像、视频、音频、文档、幻灯片、表格、PDF 或链接整合到一份创意简报中。Wan 3.0 可以利用这些来源来提供形象、运动、声音、信息及风格提示,而无需将所有细节强行塞进一个段落。

非常适合品牌讲解、一致角色、产品影片、培训内容及资产驱动的活动。

快速入门指南

如何为 Wan 3.0 准备视频素材

使用这四步工作流,现在就准备更强大的输入素材,以便在 Bananai 接入上线时无缝过渡到 Wan 3.0。

1

1. 选择明确的创作模式

决定模型是从文本构思场景、让受控图像动起来、遵循参考媒体,还是将文件转换为视频。一个明确的起始模式能保持请求的聚焦。

2

2. 仅收集有用的参考素材

选择传达明确信息的图像、剪辑、音频或文件。每个参考素材都应有明确分工,如形象、运动、产品细节、声音或已批准的事实。

3

3. 按时间顺序撰写故事

描述观众首先看到什么、接下来发生什么变化、镜头如何运动以及视频在哪里结束。为不能漂移的细节添加保留规则。

4

4. 使设置匹配最终发布目标

选择 480p、720p 或 1080p,设置 2 至 30 秒的时长,并选择横屏、正方形或竖屏比例。检查结果并在重新生成前简化过于复杂的指令。

确认规格

Wan 3.0 视频技术规格

以下 Wan 3.0 细节来自公测模型页面及 API 文档。架构、参数量、帧率及开源权重计划尚未正式公布。

2 至 30 秒

在无视频输入的情况下,模型支持 2 至 30 秒的整数输出时长。包含视频输入时,输入与输出时长之和不能超过 30 秒。

480p、720p 与 1080p

选择适合预览、Web 发布或高细节交付的清晰度等级。公测价格随选择的清晰度和生成时长而增加。

灵活的发布比例

Wan 3.0 支持自适应输出,以及用于桌面、演示文稿、正方形和移动格式的 16:9、4:3、1:1、3:4 和 9:16 比例。

20,000 字符提示词

可编写长达 20,000 字符的详细英文或中文制作方向。Wan 3.0 可以在提示词内部使用带编号的图像和视频参考。

默认原生音频

Wan 3.0 默认包含音轨,也可生成无声视频。禁用音频输出时,目前的公开 API 价格保持不变。

邀测公测阶段

Wan 3.0 已正式公布,但目前访问需要邀请。在验证生产 Provider 之前,Bananai 保持该模型为预览接入状态。

提示词指南

Wan 3.0 撰写更佳的提示词

一份实用的 Wan 3.0 提示词读起来就像一份简练的生产简报。赋予每句话明确的作用,描述可见的变化,而不是堆砌无关的形容词。

明确主体与场景

告诉 Wan 3.0 出现谁或什么、动作发生在哪、一天中的什么时间,以及观众应立即识别的视觉锚点。

按时间顺序描述动作

写下初始状态、主要动作、过渡和结尾。更长的生成窗口给予你更多时间,但每个阶段仍应服务于一个连贯的想法。

指导清晰的镜头路径

选择受控的平移、推拉、追踪、摇臂揭示、环绕或静止镜头。Wan 3.0 在有明确目的的运镜指导下表现比多个冲突运镜更好。

设定状态保留规则

指定在整个视频中哪些面部、服装、产品几何形状、颜色、Logo 位置、环境或构图必须保持稳定。

分层设定声音方向

描述前景音效、环境氛围、对话意图及音乐情绪。通过明确声音事件的时间点,将其与可见动作联系起来。

尊重所选的时长

短剪辑使用一个清晰的节拍,将多阶段动作留给更长的输出。删除在可用时间内无法展示的任何指令。

应用场景

Wan 3.0 可以在哪些方面帮助创作者

Wan 3.0 适用于源素材、视觉连贯性、原生声音或较长叙事比制作一次性运动测试更为重要的项目。

产品影片

提供产品图像、经过批准的幻灯片和结构化的展示揭示,使材质、形状、功能和最终包装盒展示始终处于故事的核心。

营销活动

在投入实际制作前,将活动简报或网页转化为横屏、正方形和竖屏概念,以便团队进行评审。

角色故事

参考图驱动的创作可以在较长的以角色为中心的序列中,支持可识别的面孔、服装、配音方向及环境。

教育讲解

提供文档、演示文稿、PDF 或网页作为源素材,然后为学习者或客户请求聚焦的视觉讲解。

分镜与预视觉化

在实拍、动画制作或客户汇报前,探索场景节奏、镜头推进、关键时刻和声音。

音乐与表演概念

将视觉参考与音频方向结合,在单个草稿中探索动作、剪辑节奏、表演调度及氛围声音。

常见问题

Wan 3.0 AI 视频生成器常见问题

关于 Wan 3.0 访问权限、功能、输入素材、输出设置及当前 Bananai 工作流的明确解答。








Wan 3.0 准备你的下一个视频

今天就使用现有的 Wan 工作流开始精炼提示词和参考素材。当 Wan 3.0 在 Bananai 上可用时,你将已经拥有清晰的故事、受控的输入和具备生产就绪水平的创意方向。

Wan 3.0 参考驱动视频与原生音频创作工作流