Wan 3.0做30秒商品视频,多张图、视频和声音参考怎么分工?

做商品视频时,手里通常不只有一张商品图。主图、细节图、手部使用图、一段对标动作视频,可能还有一段希望沿用节奏或音色的音频。把它们一起交给 Wan 3.0,期待模型“综合理解”,结果容易出现商品比例变了、出镜人物换了、镜头像在复刻原片,声音又和动作截点对不上。
Wan 3.0 的官方 API 支持参考图、参考视频和参考音频自由组合,三类素材分别计数,提示词里可以用“图 1”“视频 1”“音频 1”准确指代。先决定每项参考负责什么,通常比继续增加素材更有效。
下面用一只粉色便携榨汁杯的演示任务,把多张图、视频和声音的分工、30 秒方案、可直接改写的 Prompt、参数选择和返工方法走完。演示商品用于说明素材角色,实际效果仍需用你的素材验证;替换商品时,外观、结构和卖点要以品牌已有资料为准。
一、上传前先确定:商品外观、使用关系、动作镜头和声音分别由谁负责
多参考素材最容易出现的问题,是两份素材都在定义同一个事实。图 1 里的杯身偏矮,图 3 里的杯身偏高;参考视频里的杯子不是自己的产品;音频很欢快,镜头却要求缓慢推进。素材越多,模型面前的控制权越乱。
比较稳的做法是先在表格里写清“唯一职责”。同一件关键事实只指定一个最高优先级的来源。
| 需要锁定的事实 | 本次由谁负责 | 它只负责什么 | 不要让它同时决定什么 |
|---|---|---|---|
| 商品外观 | 图 1 | 杯体颜色、比例、杯盖、按键、密封圈和主要结构 | 人物身份、原图背景、动作和声音 |
| 商品细节 | 图 2 | 图 1 看不清的局部结构、材质和位置关系 | 另一套颜色、比例、商标或配件 |
| 使用关系 | 图 3 | 手部怎样拿取、杯体与桌面的关系、瓶口朝向 | 商品最终外观和人物身份 |
| 动作与镜头 | 视频 1 | 动作顺序、速度和镜头运动中的一项主要任务 | 原视频里的商品、人物、服装、场景和文字 |
| 听觉节奏 | 音频 1 | 音色、节拍或语调中的一项任务 | 商品外观、剧情关系和镜头顺序 |
| 成片讲什么 | Prompt | 镜头先后、每镜动作、商品露出和禁止项 | 重复改写其他素材已经定义的外观 |
这套分工是编辑方法,Wan 3.0 官方文档没有要求你必须这样填写。它主要用于减少素材互相抢控制权。官方允许参考图、参考视频和参考音频自由组合,最多可同时使用 10 张图、5 段视频和 5 段音频;素材越全,越需要在提示词里分清职责。

图片:阿里云百炼Wan 3.0官方发布页公开用例视频
二、多张商品图怎么分工:一张定主体,其他图只补不能从主图确认的信息
多张图不是让模型投票。图 1 应该拥有商品外观的最终解释权,图 2 和图 3 只补它无法确认的内容。
演示任务中的粉色便携榨汁杯可以这样分配:
| 素材 | 作用 | 提示词里的边界 |
|---|---|---|
| 图 1 | 正面商品图 | 只参考粉色机身、透明杯体、提环、按键位置、杯盖和整体比例 |
| 图 2 | 杯盖与按键近景 | 只补充按键位置、接缝和密封圈,不改变图 1 的杯体比例 |
| 图 3 | 手部拿取示意 | 只参考资料中的握持方式和桌面使用关系,不参考人物脸、服装、背景和杯体款式 |
如果图 1、图 2、图 3 来自不同颜色或不同型号的产品,不要期望模型自动判断哪张更准确。先删掉冲突素材,或者重新拍一张能同时包含主结构和关键细节的商品图。外观事实没有统一,提示词写得再长也只是不断覆盖。
图片可以用于商品、角色和风格参考,但一个镜头里不宜让每一张图都同时控制主体、人物和场景。纯商品镜头优先只引用图 1 和图 2;进入手部使用镜头时,再让图 3 接替“使用关系”的任务。
三、视频参考怎么分工:只选动作顺序或运镜中的一项
参考视频最容易被当成“整条片子照做”。如果原片里有自己的杯子、人物、厨房和字幕,而你同时要求商品继续以图 1 为准,模型就会收到两套对象定义。
演示任务使用一段 4 秒参考视频,只保留下面这条动作链:
text
水果落入杯中 -> 按下机身按键 -> 杯中液体开始旋转 -> 杯体放回桌面
对应提示词可以直接限定:
text
视频 1 只参考“水果落入杯中—按下机身按键—杯中液体旋转—放回桌面”的动作顺序、动作速度和镜头推进。
不要参考视频 1 中的商品颜色、品牌、杯体结构、人物、服装、厨房、字幕和场景。
商品外观以图 1 为唯一依据。
如果参考视频的运镜很稳,但动作不适合商品,就只借鉴运镜;如果动作价值更高,就让镜头简单一些。一个镜头同时要求复刻复杂动作、复杂运镜和商品细节,通常比只完成其中一个更容易返工。
Wan 3.0 的视频参考限制还有一条会直接影响 30 秒安排:参考视频单段最长 15 秒,总时长不超过 15 秒;有视频输入时,输入视频总时长加输出视频时长不能超过 30 秒。
这意味着:
- 参考视频 4 秒,输出最长可设 26 秒;
- 参考视频 15 秒,输出最长只有 15 秒;
- 想在 Wan 3.0 单次任务里直接输出 30 秒,不能再输入参考视频。
如果你确实要做一条 30 秒交付片,可以用两种路线:
| 路线 | Wan 3.0 单次任务 | 后期交付 |
|---|---|---|
| 30 秒直出 | 不输入参考视频,只输入图片、音频和 Prompt,时长设为 30 秒 | 直接检查生成片 |
| 保留动作参考 | 4 秒参考视频,输出设为 26 秒 | 后接 4 秒品牌信息、产品名或干净收尾画面,合成 30 秒交付版 |
不要把参考视频当成“额外附赠的 4 秒”,把输出仍然设成 30 秒。官方限制计算的是输入加输出总时长,超出后会报错或无法按预期提交。

图片:阿里云百炼Wan 3.0官方发布页公开用例视频
四、音频参考怎么分工:人声、节拍和环境声只选一个主任务
Wan 3.0 的参考音频可以用于音乐或语音,官方示例里包含提取音色特征、按台词驱动口型,也包含按节拍或语调同步画面。落到商品视频,先决定这段音频只解决什么问题。
如果画面里有人物口播,就给音频一个明确任务:
text
音频 1 只参考成年女声的音色、语速和情绪。
人物只说:“一杯鲜榨,随时开始。”不要增加价格、优惠、功效和认证。
人物口型、眨眼和轻微点头要与语音自然对应。
如果画面里没有人物说话,可以把音频当作节奏参考:
text
音频 1 只作为前 8 秒的节奏参考,用来安排按键、液体旋转和商品放回桌面的镜头截点。
不复制音频中的旋律,不增加旁白,不使用未经确认的品牌口号。
演示任务里没有真人口播,所以音频只负责节奏。它不决定杯子的样子,也不负责讲“好用”“省时”这些未经确认的卖点。声音参考和画面细节分开以后,返工时才知道该改哪一边。
音频单段最长 15 秒,最多 5 段,总时长不超过 15 秒。没有必要就不上传。模型默认输出带音轨的视频,也可以在参数里关闭声音。
五、30 秒里怎样排镜头,才能让每段只回答一个问题
下面按“4 秒参考视频 + 26 秒生成输出 + 4 秒后期收尾”组织 30 秒交付片。每个镜头只推进一件事,避免模型在 5 秒内同时完成人物换装、商品旋转、液体特写和字幕出现。
| 交付时间 | 镜头任务 | 主要素材 | 可见检查 |
|---|---|---|---|
| 0-3 秒 | 先用液体旋转和杯体结构建立产品,不先讲品牌历史 | 图 1 | 杯身、杯盖和按键是否与图 1 一致 |
| 3-7 秒 | 按参考动作完成放水果、按键和启动 | 图 2、视频 1 | 动作顺序是否清楚,原视频商品有没有被带进来 |
| 7-12 秒 | 用近景展示透明杯体和旋转状态 | 图 1、图 2、音频 1 | 液体、杯体和按键位置是否连续 |
| 12-18 秒 | 展示手部拿取和放回桌面的使用关系 | 图 3、视频 1 | 手部是否自然,杯体是否仍保持图 1 外观 |
| 18-23 秒 | 停在商品正面和关键结构,完成卖点收束 | 图 1 | 是否新增了按钮、配件或错误文字 |
| 23-26 秒 | 商品定格,右侧留出后期信息区 | 图 1 | 是否有干净区域,商品是否被文字遮挡 |
| 26-30 秒 | 后期添加品牌信息、产品名或必要使用提示 | 品牌侧提供素材 | 文案事实、授权和平台标识是否核对 |
如果采用 30 秒直出路线,可以把前 26 秒的镜头节奏拉长,让按键动作停得更久,增加一次结构近景和一次收尾定格。不要在最后几秒要求模型生成复杂品牌标语,准确文字、价格和活动信息更容易在后期回填和复核。
六、Prompt 怎么写:用“图 1、视频 1、音频 1”明确每份素材的职责
Prompt 不需要把模型能力再介绍一遍。开头先划素材权限,再写镜头顺序,最后写禁止项。下面这版可以替换商品名称和外观字段后直接使用:
text
【素材职责】
图 1 是商品外观的唯一依据:保持粉色机身、透明杯体、提环、按键位置、杯盖结构和整体比例一致。
图 2 只补充按键、杯盖接缝和密封圈的位置,不改变图 1 的颜色、比例和结构。
图 3 只参考手部拿取和放回桌面的使用关系,不参考人物身份、服装、背景和杯体款式。
视频 1 只参考“水果落入杯中—按下机身按键—杯中液体开始旋转—放回桌面”的动作顺序、动作速度和镜头推进;不参考视频 1 中的商品、人物、服装、厨房、字幕、品牌和场景。
音频 1 只作为前 8 秒的节奏参考,用来安排按键、旋转和收尾的镜头截点;不复制旋律,不增加旁白、价格、优惠和未提供的功效。
【任务】
生成一条 26 秒、9:16 竖版商品演示视频。这是一只粉色便携榨汁杯,不使用真人面部,不新增未经确认的文字和卖点。
【分镜】
镜头一:3 秒中近景,固定机位。杯中液体快速旋转,图 1 中的粉色机身、透明杯体、提环和按键清楚可见。
镜头二:4 秒中景,镜头平稳推进。水果落入杯中,手按下机身按键,动作顺序与视频 1 一致,但杯体始终以图 1 为准。
镜头三:5 秒近景,固定机位。杯中液体旋转,杯盖、接缝和密封圈与图 2 一致。
镜头四:6 秒中景,固定机位。人物手部拿起杯体,再平稳放回桌面,握持关系参考图 3,不出现人物面部。
镜头五:5 秒中景,镜头缓慢推近。商品正面停在画面中央,展示杯体结构、按键和杯盖。
镜头六:3 秒近景,固定机位。商品定格,右侧留出干净区域,方便后期添加品牌信息。
【连续性与禁止项】
全程保持图 1 中的商品颜色、比例、杯盖、按键和杯体结构,不新增第二件商品、配件、商标、价格、二维码、水印和错误文字。
手部结构自然,商品不突然变形;画面不切成原视频里的品牌广告,不复制原视频的人物、服装、厨房和字幕。
声音只按音频 1 的节奏安排按键和镜头截点,不要出现未经确认的商品功效、促销信息和人物旁白。
如果采用 30 秒直出,把任务时长和分镜时间改成 30 秒,同时删除视频 1 的引用和对应动作参考。这里要改的是任务结构,不能只把“26 秒”替换成“30 秒”,却继续保留 4 秒参考视频。
七、提交前怎样选参数和素材组合,避免报错与无效重跑
官方 API 的任务模式通过 media 数组区分素材类型。商品演示通常走参考生视频,参数可以这样起步:
| 参数 | 建议起点 | 原因 |
|---|---|---|
| 模型 | wan3.0-video |
标准版;需要更快响应时再看优速版 |
| 分辨率 | 720P |
先验证商品结构和动作,再决定是否换高清 |
| 宽高比 | 9:16,素材比例复杂时用 adaptive |
竖版短视频或自适应参考素材 |
| 时长 | 无视频输入设 30;输入 4 秒视频设 26 | 有视频输入时,输入和输出总时长不超过 30 秒 |
| 声音 | audio=true |
需要输出音轨时开启;不需要可关闭 |
| 提示词改写 | 完整职责 Prompt 可先关闭;使用文件或网页时必须开启 | 避免职责句被额外改写;文档和网页模式要求开启 |
素材组合上,reference_image、reference_video 和 reference_audio 可以自由组合;但首帧和尾帧与这些参考素材互斥,不能放在同一请求中。需要音频驱动时,走参考图片加参考音频的组合,不要把音频硬塞进首尾帧模式。
上传顺序也要和 Prompt 对齐。图片、视频、音频分别计数,第 1 张 reference_image 对应“图 1”,第 1 段 reference_video 对应“视频 1”,第 1 段 reference_audio 对应“音频 1”。更换素材后,先检查 Prompt 里的编号有没有跟着改。
八、生成后怎样验收商品、动作、声音和叙事
不要先看“像不像广告”,先检查每份输入是否按约定生效。
| 验收项 | 检查方法 | 常见失败 |
|---|---|---|
| 商品一致性 | 逐镜头核对颜色、比例、杯盖、按键和透明杯体 | 杯体变高、按钮消失、出现第二件商品 |
| 动作正确性 | 对照视频 1 检查顺序和速度,不要求复刻原片主体 | 参考视频里的杯子、手或厨房被带入 |
| 声音对应 | 听按键、旋转和镜头截点是否落在同一节奏 | 音乐抢拍、旁白讲了未确认卖点 |
| 镜头连续性 | 看六段镜头是否每段只完成一个任务 | 同一镜头同时换场景、换动作和换主体 |
| 交付完整性 | 确认 9:16、26 秒生成片和 4 秒后期信息区能顺接 | 生成 30 秒后又叠加 4 秒,成片变成 34 秒 |
| 发布边界 | 核对商品描述、人物授权、平台规则和生成内容标识 | 价格、认证、功效或真人素材没有授权 |

图片:阿里云百炼Wan 3.0官方发布页公开用例视频
商品一致性排在第一位。商品不一致时,先回查图 1 是否真的是唯一外观来源,再检查视频参考有没有把原商品带进来。不要把问题直接归因于模型画质。
九、出现商品漂移、人物变化和音画错位时怎么返工
返工要回到对应的输入层,不要第一轮就重写整条 Prompt。
商品颜色或比例漂移时,先删除与图 1 冲突的商品图。图 2 只保留局部结构,不再声明完整外观;视频参考补上“不参考原商品外观”。如果商品仍然变化,缩短单段时长,把复杂动作拆开。
出现人物或手部异常时,检查是否同时使用了人物图、手部参考和带人物的视频参考。没有必要的发言人物就删掉身份参考,保留图 3 的握持关系即可。涉及真人图像时,只能使用已经获得授权的素材。
动作对但镜头太乱时,缩小参考视频的职责,只保留动作顺序或运镜其中一项。动作太复杂,就把“拿取—按键—旋转—放回”拆成两个生成任务,再在后期衔接。
音画不一致时,先确认音频到底是声音参考还是后期配乐。音频参考只提供音色、语调或节拍时,Prompt 不要再让它决定剧情。需要精确文案的旁白,最好在后期完成并单独核对。
提交后提示时长或素材组合错误时,按官方限制重新算:代码里最长可生成 30 秒;视频输入总时长加输出时长不超过 30 秒;首尾帧不能和参考图片、参考视频、参考音频同时使用;文件与网页链接二选一。
十、素材较多时,怎样把策划、生成和交付记录接起来
商品图、动作样片和音轨都会有多个版本。团队最常卡在版本对应关系:图 1、视频 1 和音频 1 分别指哪份文件,返工后又把旧版本重新上传。
如果当前工作流已经有一组商品素材和目标平台,缺的是素材整理、脚本与生成任务的串联,**技灵AI营销助手**的视频解析可以拆解参考视频的脚本与镜头,智能策划可以组织商品资料和分镜,视频生成中列有 Wan 3.0 等模型,无限画布适合继续组织图片、视频和音频节点。具体可用模型、规格和权益以产品页面为准。

它不会替品牌确认商品外观、卖点事实、人物授权和投放合规。图 1 的商品结构、视频 1 的使用权、音频 1 的版权和后期字幕,仍要在提交前由业务侧核对。
先选一个 SKU,只保留一张商品外观主图、一张细节图和一张使用关系图;准备一段 4 秒动作参考、一段 8 秒节奏参考;按“26 秒生成片 + 4 秒后期收尾”跑第一条,再对照验收表决定是缩短动作、删除冲突素材,还是切换到 30 秒直出路线。这样比一次上传十几份素材,更容易知道问题到底出在哪一层。