从多种参考开始

Wan 3.0 多模态:照片、素材与音频一起用

text-to-videoimage-to-videovideo-to-video

当一段提示词、一张照片或一条素材都不够用时,就把几个文件放进同一次生成里。给每个文件一个明确任务——外观、运动或节奏——并且把文字写得足够短,只用来解决冲突。你可以生成最高 4K 的画面和最长 30 秒的片段。

多模态

组合图片、视频和音频素材生成视频

已选择 0/2 帧
首帧*
尾帧(可选)

上传 1-3 个视频作为额外多模态素材

0 / 2000

提示:越详细具体效果越好。描述主体、风格、光线、氛围和构图。

可用积分
--

示例图库

看看你能用 multi modal 创作什么

案例展示

浏览 AI 视频示例片段。点击任意方块即可播放完整片段。

AI Video Thumbnail
AI Video Thumbnail
AI Video Thumbnail
AI Video Thumbnail
AI Video Thumbnail
AI Video Thumbnail
AI Video Thumbnail
AI Video Thumbnail
AI Video Thumbnail
AI Video Thumbnail
AI Video Thumbnail
AI Video Thumbnail
AI Video Thumbnail

页面中展示的所有视频和图片均为 AI 生成的合成内容,除另有明确说明外,不代表真实人物或真实事件。

Wan 3.0 有哪些新变化

更长的片段、更清晰的画面,起点也更明确

Wan 3.0 让日常的 AI 视频创作更好用。你可以生成最高 4K、最长 30 秒的片段,并且从手头已有的素材出发——文字、一张照片或一段视频。这意味着后期要拼接的碎片更少,也更适合社交广告、产品演示和早期的场景试拍。

最高 4K 输出

当细节重要时,为产品页、广告和客户评审拿到更清晰的画面。

片段最长 30 秒

把一个钩子、一段演示或一个小故事更完整地放进一条片段,不用再拼很多短镜头。

从文字、照片或视频开始

写一个场景、让一张照片动起来,或者在节奏已经合适时给一段视频换个风格。

创作者为什么用 Wan 3.0

对真实项目有实际帮助

在约拍或正式剪辑之前,先做出最长 30 秒的概念片

把产品图和角色图变成动态画面,不用从零重建外观

在手头已有的素材上试试新风格

在浏览器里创作,队友能更快看到样片并给出反馈

怎样把多个文件组合起来又不让结果变糊

当外观、运动和节奏分散在不同文件里时该怎么做

给每个素材分配任务

决定哪个文件定外观、哪个定运动、哪个定节奏。任务分清了,上传的文件才不会在同一次请求里互相抢。如果两个文件都在抢同一个任务,先删掉一个,别急着把提示词写得更长。

让文字引导和素材参考保持平衡

让上传的文件承载它们本身就有的细节。文字用来解决冲突,而不是把每个文件里的每个像素再复述一遍。当那段文字比任务清单还长,你很可能是在和自己的素材较劲。

检查每个文件是否彼此相符

生成之后,看看脸、产品、运动和节奏是否还对得上。这种一致性就是多输入任务的质量关口。哪一项没过,就只改对应的那个文件或那一行。

去掉互相冲突的指令

如果静态图是白天、提示词写的是夜晚,那就二选一。彼此一致的信号,比精巧的自相矛盾更能出好画面。把消除冲突当成前期准备,别指望生成器会替你神奇地调停。

先精简,再加参考

先用这个镜头最低限度需要的静态图、素材和声音开始。多余的上传常常会稀释主体,也让排查问题更难。只有在精简的第一轮之后还明显缺东西时,才再加一个参考。

更简单的活儿就用单输入页面

如果你只有文字、一张静态图或一条素材,就打开对应的工具,别硬凑一个多文件的组合。复杂度应该跟着你真正拥有的素材清单走。及早分流,能让大家不必在错误的工具里查问题。

这个工作流怎么用

从分配素材任务到一次合并生成

1

收集多种参考

把这个镜头需要的静态图、素材和声音文件收齐。上传之前先标出每个文件的任务,让团队对分工有同一份地图。一份共享清单,能避免大家对“哪个文件是主角”产生说不出口的分歧。

2

写一段能处理冲突的提示词

说明这些文件该如何配合。文字写得足够短,让素材保持主导。你的句子应该给分歧当裁判,而不是重复上传文件里已经看得到的东西。

3

生成并审查连贯性

回看这条片段,检查外观、运动和节奏是否彼此相符。下一轮之前,调整素材的任务分配,或者去掉一个参考。任务更清楚的小组合,通常胜过一大堆只靠模糊期待的文件。

为什么用多输入工作流

当素材以不同形式到手时的优势

工具之间少来回

把静态图、素材和声音参考放在同一次生成里,不用在各个单输入页面之间来回跳。来回越少,项目中途丢掉任务分工的机会就越少。当时间紧、素材又分散在不同文件夹里时,这一点尤其重要。

更丰富的控制信号

在同一次请求里,每种媒体都能贡献一个不同的约束——外观、运动或节奏。当所有东西都被压平成一段形容词时,这种分工就很难保持。

更清楚的创意说明

规划素材任务会逼着团队在开始生成之前说清每个文件是干什么的。含糊之处会在清单上暴露出来,而不是等到失败的结果之后才显现。把任务清单写在协作者都能看到的地方。

更明确的迭代目标

连贯性出问题时,你能知道该换一个上传文件、改提示词,还是调整文件之间的比重。有针对性的修正胜过带着更大、更吵的素材包重新开始。留一份简短的变更记录,下一轮每个修正就都有明确负责人。

可复用的参考素材包

把一套跑得通的文件保存下来,只做少量提示词改动就能用于其他镜头。稳定的素材包,能让系列作品在不同集数或活动章节之间保持一致。

诚实的工作流分流

这个页面留给多输入的任务。更简单的活儿留在各自的工具页面,谁都不必被迫承担多出来的复杂度。

多输入创作能帮上忙的场景

需要不止一种媒体类型的工作

品牌素材包组装

当活动素材已经以不同格式存在时,把一张产品静图、一条运动参考和一个节奏提示组合起来。任务标签能让这个素材包不至于变成一堆互相抢戏的主角文件。

锁定角色形象加运动

当一张静态图无法同时提供两者时,就用一张图片定形象、一条素材定动作。静态图守住相似度,素材教会节奏,不必让文字凭空造出这两样。

以音频主导的画面草稿

把旁白或音乐和视觉参考搭在一起,让节奏更贴合声音底层。以节奏为先的草稿,能让剪辑师在完整时间线出现之前就先感受到剪点。

活动素材的混搭测试

把已通过评审的静态图和以前的素材混在一起,探索新的处理方式,不必从一段空白提示词开始。复用已知素材,能在测试新组合的同时保留品牌记忆。

从分镜快速出预览

当导演想要一个快速预览时,把分镜画面和一个节奏参考一起喂进去。目标是做出一个决定,而不是一条成片。评审者可以在任何人打开完整剪辑之前就先争论方向。

本地化剪辑探索

让视觉参考保持不变,只替换以语言为主导的声音素材,做出不同市场的草稿。锁住视觉、替换音频,通常比为每个地区把整个外观重新生成一遍更稳妥。

常见问题

上传一组文件之前的简短解答

01

Wan 3.0 多模态是做什么的?

用 Wan 3.0 多模态,你可以在浏览器里把图片、视频和声音参考一次组合生成。这里的文案描述的是本站工作流,不是阿里官方模型发布说明。

02

什么时候该用 Wan 3.0 多模态而不是文字转视频?

当你已有多个必须一起配合的文件时,用 Wan 3.0 多模态。如果只有文字,留在 Wan 3.0 文字转视频。没有职责的多余上传通常只会更乱。

03

怎么给每个素材分配任务?

上传之前,标明每个文件控制的是外观、运动还是节奏。这份任务清单应当同时指导你的提示词和连贯性检查。

04

如果上传的文件互相矛盾怎么办?

把冲突的那个文件删掉或换掉。当上传的文件给出相反指令时,结果会变差。别指望提示词去调停素材之间已经打起来的架。

05

Wan 3.0 多模态和视频转视频有何不同?

Wan 3.0 视频转视频从一段成片开始;Wan 3.0 多模态面向同一次请求里的多种媒体。单段成片够用时选更简单的页面。

06

生成之后该检查什么?

检查形象、运动路径和节奏。如果其中一项不行,只改相关的那个素材或那条指令,这样你才能知道是哪个信号起了作用。

07

该把手上所有文件都上传吗?

不用。先用能覆盖外观、运动和节奏的最小一组开始。只有在精简的第一轮之后还有缺口时,才再加文件。

08

可以生成多大的画面?

Wan 3.0 支持 4K 视频输出和最长 30 秒的片段。先确认任务分工和连贯性,等这组素材依然彼此相符,再提高时长或分辨率。

在 Wan 3.0 多模态里组合输入

分配素材任务,让简短文字和素材保持平衡,再用一组精简的文件生成

在浏览器里就能用