Wan 3.0 多模态:照片、素材与音频一起用
当一段提示词、一张照片或一条素材都不够用时,就把几个文件放进同一次生成里。给每个文件一个明确任务——外观、运动或节奏——并且把文字写得足够短,只用来解决冲突。你可以生成最高 4K 的画面和最长 30 秒的片段。
组合图片、视频和音频素材生成视频
上传 1-3 个视频作为额外多模态素材
提示:越详细具体效果越好。描述主体、风格、光线、氛围和构图。
示例图库
看看你能用 multi modal 创作什么
作品集
滑动浏览示例片段。点按任意视频即可全屏播放。
案例展示
浏览 AI 视频示例片段。点击任意方块即可播放完整片段。













页面中展示的所有视频和图片均为 AI 生成的合成内容,除另有明确说明外,不代表真实人物或真实事件。
Wan 3.0 有哪些新变化
更长的片段、更清晰的画面,起点也更明确
Wan 3.0 让日常的 AI 视频创作更好用。你可以生成最高 4K、最长 30 秒的片段,并且从手头已有的素材出发——文字、一张照片或一段视频。这意味着后期要拼接的碎片更少,也更适合社交广告、产品演示和早期的场景试拍。
最高 4K 输出
当细节重要时,为产品页、广告和客户评审拿到更清晰的画面。
片段最长 30 秒
把一个钩子、一段演示或一个小故事更完整地放进一条片段,不用再拼很多短镜头。
从文字、照片或视频开始
写一个场景、让一张照片动起来,或者在节奏已经合适时给一段视频换个风格。
创作者为什么用 Wan 3.0
对真实项目有实际帮助
在约拍或正式剪辑之前,先做出最长 30 秒的概念片
把产品图和角色图变成动态画面,不用从零重建外观
在手头已有的素材上试试新风格
在浏览器里创作,队友能更快看到样片并给出反馈
怎样把多个文件组合起来又不让结果变糊
当外观、运动和节奏分散在不同文件里时该怎么做
给每个素材分配任务
决定哪个文件定外观、哪个定运动、哪个定节奏。任务分清了,上传的文件才不会在同一次请求里互相抢。如果两个文件都在抢同一个任务,先删掉一个,别急着把提示词写得更长。
让文字引导和素材参考保持平衡
让上传的文件承载它们本身就有的细节。文字用来解决冲突,而不是把每个文件里的每个像素再复述一遍。当那段文字比任务清单还长,你很可能是在和自己的素材较劲。
检查每个文件是否彼此相符
生成之后,看看脸、产品、运动和节奏是否还对得上。这种一致性就是多输入任务的质量关口。哪一项没过,就只改对应的那个文件或那一行。
去掉互相冲突的指令
如果静态图是白天、提示词写的是夜晚,那就二选一。彼此一致的信号,比精巧的自相矛盾更能出好画面。把消除冲突当成前期准备,别指望生成器会替你神奇地调停。
先精简,再加参考
先用这个镜头最低限度需要的静态图、素材和声音开始。多余的上传常常会稀释主体,也让排查问题更难。只有在精简的第一轮之后还明显缺东西时,才再加一个参考。
更简单的活儿就用单输入页面
如果你只有文字、一张静态图或一条素材,就打开对应的工具,别硬凑一个多文件的组合。复杂度应该跟着你真正拥有的素材清单走。及早分流,能让大家不必在错误的工具里查问题。
这个工作流怎么用
从分配素材任务到一次合并生成
收集多种参考
把这个镜头需要的静态图、素材和声音文件收齐。上传之前先标出每个文件的任务,让团队对分工有同一份地图。一份共享清单,能避免大家对“哪个文件是主角”产生说不出口的分歧。
写一段能处理冲突的提示词
说明这些文件该如何配合。文字写得足够短,让素材保持主导。你的句子应该给分歧当裁判,而不是重复上传文件里已经看得到的东西。
生成并审查连贯性
回看这条片段,检查外观、运动和节奏是否彼此相符。下一轮之前,调整素材的任务分配,或者去掉一个参考。任务更清楚的小组合,通常胜过一大堆只靠模糊期待的文件。
为什么用多输入工作流
当素材以不同形式到手时的优势
工具之间少来回
把静态图、素材和声音参考放在同一次生成里,不用在各个单输入页面之间来回跳。来回越少,项目中途丢掉任务分工的机会就越少。当时间紧、素材又分散在不同文件夹里时,这一点尤其重要。
更丰富的控制信号
在同一次请求里,每种媒体都能贡献一个不同的约束——外观、运动或节奏。当所有东西都被压平成一段形容词时,这种分工就很难保持。
更清楚的创意说明
规划素材任务会逼着团队在开始生成之前说清每个文件是干什么的。含糊之处会在清单上暴露出来,而不是等到失败的结果之后才显现。把任务清单写在协作者都能看到的地方。
更明确的迭代目标
连贯性出问题时,你能知道该换一个上传文件、改提示词,还是调整文件之间的比重。有针对性的修正胜过带着更大、更吵的素材包重新开始。留一份简短的变更记录,下一轮每个修正就都有明确负责人。
可复用的参考素材包
把一套跑得通的文件保存下来,只做少量提示词改动就能用于其他镜头。稳定的素材包,能让系列作品在不同集数或活动章节之间保持一致。
诚实的工作流分流
这个页面留给多输入的任务。更简单的活儿留在各自的工具页面,谁都不必被迫承担多出来的复杂度。
多输入创作能帮上忙的场景
需要不止一种媒体类型的工作
品牌素材包组装
当活动素材已经以不同格式存在时,把一张产品静图、一条运动参考和一个节奏提示组合起来。任务标签能让这个素材包不至于变成一堆互相抢戏的主角文件。
锁定角色形象加运动
当一张静态图无法同时提供两者时,就用一张图片定形象、一条素材定动作。静态图守住相似度,素材教会节奏,不必让文字凭空造出这两样。
以音频主导的画面草稿
把旁白或音乐和视觉参考搭在一起,让节奏更贴合声音底层。以节奏为先的草稿,能让剪辑师在完整时间线出现之前就先感受到剪点。
活动素材的混搭测试
把已通过评审的静态图和以前的素材混在一起,探索新的处理方式,不必从一段空白提示词开始。复用已知素材,能在测试新组合的同时保留品牌记忆。
从分镜快速出预览
当导演想要一个快速预览时,把分镜画面和一个节奏参考一起喂进去。目标是做出一个决定,而不是一条成片。评审者可以在任何人打开完整剪辑之前就先争论方向。
本地化剪辑探索
让视觉参考保持不变,只替换以语言为主导的声音素材,做出不同市场的草稿。锁住视觉、替换音频,通常比为每个地区把整个外观重新生成一遍更稳妥。
常见问题
上传一组文件之前的简短解答
Wan 3.0 多模态是做什么的?
用 Wan 3.0 多模态,你可以在浏览器里把图片、视频和声音参考一次组合生成。这里的文案描述的是本站工作流,不是阿里官方模型发布说明。
什么时候该用 Wan 3.0 多模态而不是文字转视频?
当你已有多个必须一起配合的文件时,用 Wan 3.0 多模态。如果只有文字,留在 Wan 3.0 文字转视频。没有职责的多余上传通常只会更乱。
怎么给每个素材分配任务?
上传之前,标明每个文件控制的是外观、运动还是节奏。这份任务清单应当同时指导你的提示词和连贯性检查。
如果上传的文件互相矛盾怎么办?
把冲突的那个文件删掉或换掉。当上传的文件给出相反指令时,结果会变差。别指望提示词去调停素材之间已经打起来的架。
Wan 3.0 多模态和视频转视频有何不同?
Wan 3.0 视频转视频从一段成片开始;Wan 3.0 多模态面向同一次请求里的多种媒体。单段成片够用时选更简单的页面。
生成之后该检查什么?
检查形象、运动路径和节奏。如果其中一项不行,只改相关的那个素材或那条指令,这样你才能知道是哪个信号起了作用。
该把手上所有文件都上传吗?
不用。先用能覆盖外观、运动和节奏的最小一组开始。只有在精简的第一轮之后还有缺口时,才再加文件。
可以生成多大的画面?
Wan 3.0 支持 4K 视频输出和最长 30 秒的片段。先确认任务分工和连贯性,等这组素材依然彼此相符,再提高时长或分辨率。