[{"data":1,"prerenderedAt":11},["ShallowReactive",2],{"article-en-1":3},{"id":4,"title":5,"description":6,"classname":7,"content":8,"cover":9,"publishTime":-1,"updateTime":10},"1","Wan 3.0做30秒商品视频，多张图、视频和声音参考怎么分工？","Wan 3.0、Prompt","教程干货","![](https:\u002F\u002Foss.jeekmind.com\u002Fcarimg\u002F09b5fa\u002F2026-09\u002F1\u002F1f7bc36abede281f.png)\n\n做商品视频时，手里通常不只有一张商品图。主图、细节图、手部使用图、一段对标动作视频，可能还有一段希望沿用节奏或音色的音频。把它们一起交给 Wan 3.0，期待模型“综合理解”，结果容易出现商品比例变了、出镜人物换了、镜头像在复刻原片，声音又和动作截点对不上。\n\nWan 3.0 的官方 API 支持参考图、参考视频和参考音频自由组合，三类素材分别计数，提示词里可以用“图 1”“视频 1”“音频 1”准确指代。先决定每项参考负责什么，通常比继续增加素材更有效。\n\n下面用一只粉色便携榨汁杯的演示任务，把多张图、视频和声音的分工、30 秒方案、可直接改写的 Prompt、参数选择和返工方法走完。演示商品用于说明素材角色，实际效果仍需用你的素材验证；替换商品时，外观、结构和卖点要以品牌已有资料为准。\n\n## 一、上传前先确定：商品外观、使用关系、动作镜头和声音分别由谁负责\n\n多参考素材最容易出现的问题，是两份素材都在定义同一个事实。图 1 里的杯身偏矮，图 3 里的杯身偏高；参考视频里的杯子不是自己的产品；音频很欢快，镜头却要求缓慢推进。素材越多，模型面前的控制权越乱。\n\n比较稳的做法是先在表格里写清“唯一职责”。同一件关键事实只指定一个最高优先级的来源。\n\n| 需要锁定的事实 | 本次由谁负责 | 它只负责什么                                 | 不要让它同时决定什么                   |\n| -------------- | ------------ | -------------------------------------------- | -------------------------------------- |\n| 商品外观       | 图 1         | 杯体颜色、比例、杯盖、按键、密封圈和主要结构 | 人物身份、原图背景、动作和声音         |\n| 商品细节       | 图 2         | 图 1 看不清的局部结构、材质和位置关系        | 另一套颜色、比例、商标或配件           |\n| 使用关系       | 图 3         | 手部怎样拿取、杯体与桌面的关系、瓶口朝向     | 商品最终外观和人物身份                 |\n| 动作与镜头     | 视频 1       | 动作顺序、速度和镜头运动中的一项主要任务     | 原视频里的商品、人物、服装、场景和文字 |\n| 听觉节奏       | 音频 1       | 音色、节拍或语调中的一项任务                 | 商品外观、剧情关系和镜头顺序           |\n| 成片讲什么     | Prompt       | 镜头先后、每镜动作、商品露出和禁止项         | 重复改写其他素材已经定义的外观         |\n\n这套分工是编辑方法，Wan 3.0 官方文档没有要求你必须这样填写。它主要用于减少素材互相抢控制权。官方允许参考图、参考视频和参考音频自由组合，最多可同时使用 10 张图、5 段视频和 5 段音频；素材越全，越需要在提示词里分清职责。\n\n![](https:\u002F\u002Foss.jeekmind.com\u002Fcarimg\u002F09b5fa\u002F2026-09\u002F1\u002F0c7d13696e15c0d9.png)\n\n\n图片：阿里云百炼Wan 3.0官方发布页公开用例视频\n\n## 二、多张商品图怎么分工：一张定主体，其他图只补不能从主图确认的信息\n\n多张图不是让模型投票。图 1 应该拥有商品外观的最终解释权，图 2 和图 3 只补它无法确认的内容。\n\n演示任务中的粉色便携榨汁杯可以这样分配：\n\n| 素材 | 作用           | 提示词里的边界                                               |\n| ---- | -------------- | ------------------------------------------------------------ |\n| 图 1 | 正面商品图     | 只参考粉色机身、透明杯体、提环、按键位置、杯盖和整体比例     |\n| 图 2 | 杯盖与按键近景 | 只补充按键位置、接缝和密封圈，不改变图 1 的杯体比例          |\n| 图 3 | 手部拿取示意   | 只参考资料中的握持方式和桌面使用关系，不参考人物脸、服装、背景和杯体款式 |\n\n如果图 1、图 2、图 3 来自不同颜色或不同型号的产品，不要期望模型自动判断哪张更准确。先删掉冲突素材，或者重新拍一张能同时包含主结构和关键细节的商品图。外观事实没有统一，提示词写得再长也只是不断覆盖。\n\n图片可以用于商品、角色和风格参考，但一个镜头里不宜让每一张图都同时控制主体、人物和场景。纯商品镜头优先只引用图 1 和图 2；进入手部使用镜头时，再让图 3 接替“使用关系”的任务。\n\n## 三、视频参考怎么分工：只选动作顺序或运镜中的一项\n\n参考视频最容易被当成“整条片子照做”。如果原片里有自己的杯子、人物、厨房和字幕，而你同时要求商品继续以图 1 为准，模型就会收到两套对象定义。\n\n演示任务使用一段 4 秒参考视频，只保留下面这条动作链：\n\n```text\n水果落入杯中 -> 按下机身按键 -> 杯中液体开始旋转 -> 杯体放回桌面\n```\n\n对应提示词可以直接限定：\n\n```text\n视频 1 只参考“水果落入杯中—按下机身按键—杯中液体旋转—放回桌面”的动作顺序、动作速度和镜头推进。\n不要参考视频 1 中的商品颜色、品牌、杯体结构、人物、服装、厨房、字幕和场景。\n商品外观以图 1 为唯一依据。\n```\n\n如果参考视频的运镜很稳，但动作不适合商品，就只借鉴运镜；如果动作价值更高，就让镜头简单一些。一个镜头同时要求复刻复杂动作、复杂运镜和商品细节，通常比只完成其中一个更容易返工。\n\nWan 3.0 的视频参考限制还有一条会直接影响 30 秒安排：参考视频单段最长 15 秒，总时长不超过 15 秒；有视频输入时，输入视频总时长加输出视频时长不能超过 30 秒。\n\n这意味着：\n\n- 参考视频 4 秒，输出最长可设 26 秒；\n- 参考视频 15 秒，输出最长只有 15 秒；\n- 想在 Wan 3.0 单次任务里直接输出 30 秒，不能再输入参考视频。\n\n如果你确实要做一条 30 秒交付片，可以用两种路线：\n\n| 路线         | Wan 3.0 单次任务                                          | 后期交付                                                  |\n| ------------ | --------------------------------------------------------- | --------------------------------------------------------- |\n| 30 秒直出    | 不输入参考视频，只输入图片、音频和 Prompt，时长设为 30 秒 | 直接检查生成片                                            |\n| 保留动作参考 | 4 秒参考视频，输出设为 26 秒                              | 后接 4 秒品牌信息、产品名或干净收尾画面，合成 30 秒交付版 |\n\n不要把参考视频当成“额外附赠的 4 秒”，把输出仍然设成 30 秒。官方限制计算的是输入加输出总时长，超出后会报错或无法按预期提交。\n![](https:\u002F\u002Foss.jeekmind.com\u002Fcarimg\u002F09b5fa\u002F2026-09\u002F1\u002F320ab2098b71286e.png)\n\n\n图片：阿里云百炼Wan 3.0官方发布页公开用例视频\n\n## 四、音频参考怎么分工：人声、节拍和环境声只选一个主任务\n\nWan 3.0 的参考音频可以用于音乐或语音，官方示例里包含提取音色特征、按台词驱动口型，也包含按节拍或语调同步画面。落到商品视频，先决定这段音频只解决什么问题。\n\n如果画面里有人物口播，就给音频一个明确任务：\n\n```text\n音频 1 只参考成年女声的音色、语速和情绪。\n人物只说：“一杯鲜榨，随时开始。”不要增加价格、优惠、功效和认证。\n人物口型、眨眼和轻微点头要与语音自然对应。\n```\n\n如果画面里没有人物说话，可以把音频当作节奏参考：\n\n```text\n音频 1 只作为前 8 秒的节奏参考，用来安排按键、液体旋转和商品放回桌面的镜头截点。\n不复制音频中的旋律，不增加旁白，不使用未经确认的品牌口号。\n```\n\n演示任务里没有真人口播，所以音频只负责节奏。它不决定杯子的样子，也不负责讲“好用”“省时”这些未经确认的卖点。声音参考和画面细节分开以后，返工时才知道该改哪一边。\n\n音频单段最长 15 秒，最多 5 段，总时长不超过 15 秒。没有必要就不上传。模型默认输出带音轨的视频，也可以在参数里关闭声音。\n\n## 五、30 秒里怎样排镜头，才能让每段只回答一个问题\n\n下面按“4 秒参考视频 + 26 秒生成输出 + 4 秒后期收尾”组织 30 秒交付片。每个镜头只推进一件事，避免模型在 5 秒内同时完成人物换装、商品旋转、液体特写和字幕出现。\n\n| 交付时间 | 镜头任务                                       | 主要素材           | 可见检查                                   |\n| -------- | ---------------------------------------------- | ------------------ | ------------------------------------------ |\n| 0-3 秒   | 先用液体旋转和杯体结构建立产品，不先讲品牌历史 | 图 1               | 杯身、杯盖和按键是否与图 1 一致            |\n| 3-7 秒   | 按参考动作完成放水果、按键和启动               | 图 2、视频 1       | 动作顺序是否清楚，原视频商品有没有被带进来 |\n| 7-12 秒  | 用近景展示透明杯体和旋转状态                   | 图 1、图 2、音频 1 | 液体、杯体和按键位置是否连续               |\n| 12-18 秒 | 展示手部拿取和放回桌面的使用关系               | 图 3、视频 1       | 手部是否自然，杯体是否仍保持图 1 外观      |\n| 18-23 秒 | 停在商品正面和关键结构，完成卖点收束           | 图 1               | 是否新增了按钮、配件或错误文字             |\n| 23-26 秒 | 商品定格，右侧留出后期信息区                   | 图 1               | 是否有干净区域，商品是否被文字遮挡         |\n| 26-30 秒 | 后期添加品牌信息、产品名或必要使用提示         | 品牌侧提供素材     | 文案事实、授权和平台标识是否核对           |\n\n如果采用 30 秒直出路线，可以把前 26 秒的镜头节奏拉长，让按键动作停得更久，增加一次结构近景和一次收尾定格。不要在最后几秒要求模型生成复杂品牌标语，准确文字、价格和活动信息更容易在后期回填和复核。\n\n## 六、Prompt 怎么写：用“图 1、视频 1、音频 1”明确每份素材的职责\n\nPrompt 不需要把模型能力再介绍一遍。开头先划素材权限，再写镜头顺序，最后写禁止项。下面这版可以替换商品名称和外观字段后直接使用：\n\n```text\n【素材职责】\n图 1 是商品外观的唯一依据：保持粉色机身、透明杯体、提环、按键位置、杯盖结构和整体比例一致。\n图 2 只补充按键、杯盖接缝和密封圈的位置，不改变图 1 的颜色、比例和结构。\n图 3 只参考手部拿取和放回桌面的使用关系，不参考人物身份、服装、背景和杯体款式。\n视频 1 只参考“水果落入杯中—按下机身按键—杯中液体开始旋转—放回桌面”的动作顺序、动作速度和镜头推进；不参考视频 1 中的商品、人物、服装、厨房、字幕、品牌和场景。\n音频 1 只作为前 8 秒的节奏参考，用来安排按键、旋转和收尾的镜头截点；不复制旋律，不增加旁白、价格、优惠和未提供的功效。\n\n【任务】\n生成一条 26 秒、9:16 竖版商品演示视频。这是一只粉色便携榨汁杯，不使用真人面部，不新增未经确认的文字和卖点。\n\n【分镜】\n镜头一：3 秒中近景，固定机位。杯中液体快速旋转，图 1 中的粉色机身、透明杯体、提环和按键清楚可见。\n镜头二：4 秒中景，镜头平稳推进。水果落入杯中，手按下机身按键，动作顺序与视频 1 一致，但杯体始终以图 1 为准。\n镜头三：5 秒近景，固定机位。杯中液体旋转，杯盖、接缝和密封圈与图 2 一致。\n镜头四：6 秒中景，固定机位。人物手部拿起杯体，再平稳放回桌面，握持关系参考图 3，不出现人物面部。\n镜头五：5 秒中景，镜头缓慢推近。商品正面停在画面中央，展示杯体结构、按键和杯盖。\n镜头六：3 秒近景，固定机位。商品定格，右侧留出干净区域，方便后期添加品牌信息。\n\n【连续性与禁止项】\n全程保持图 1 中的商品颜色、比例、杯盖、按键和杯体结构，不新增第二件商品、配件、商标、价格、二维码、水印和错误文字。\n手部结构自然，商品不突然变形；画面不切成原视频里的品牌广告，不复制原视频的人物、服装、厨房和字幕。\n声音只按音频 1 的节奏安排按键和镜头截点，不要出现未经确认的商品功效、促销信息和人物旁白。\n```\n\n如果采用 30 秒直出，把任务时长和分镜时间改成 30 秒，同时删除视频 1 的引用和对应动作参考。这里要改的是任务结构，不能只把“26 秒”替换成“30 秒”，却继续保留 4 秒参考视频。\n\n## 七、提交前怎样选参数和素材组合，避免报错与无效重跑\n\n官方 API 的任务模式通过 `media` 数组区分素材类型。商品演示通常走参考生视频，参数可以这样起步：\n\n| 参数       | 建议起点                                           | 原因                                         |\n| ---------- | -------------------------------------------------- | -------------------------------------------- |\n| 模型       | `wan3.0-video`                                     | 标准版；需要更快响应时再看优速版             |\n| 分辨率     | `720P`                                             | 先验证商品结构和动作，再决定是否换高清       |\n| 宽高比     | `9:16`，素材比例复杂时用 `adaptive`                | 竖版短视频或自适应参考素材                   |\n| 时长       | 无视频输入设 30；输入 4 秒视频设 26                | 有视频输入时，输入和输出总时长不超过 30 秒   |\n| 声音       | `audio=true`                                       | 需要输出音轨时开启；不需要可关闭             |\n| 提示词改写 | 完整职责 Prompt 可先关闭；使用文件或网页时必须开启 | 避免职责句被额外改写；文档和网页模式要求开启 |\n\n素材组合上，`reference_image`、`reference_video` 和 `reference_audio` 可以自由组合；但首帧和尾帧与这些参考素材互斥，不能放在同一请求中。需要音频驱动时，走参考图片加参考音频的组合，不要把音频硬塞进首尾帧模式。\n\n上传顺序也要和 Prompt 对齐。图片、视频、音频分别计数，第 1 张 `reference_image` 对应“图 1”，第 1 段 `reference_video` 对应“视频 1”，第 1 段 `reference_audio` 对应“音频 1”。更换素材后，先检查 Prompt 里的编号有没有跟着改。\n\n## 八、生成后怎样验收商品、动作、声音和叙事\n\n不要先看“像不像广告”，先检查每份输入是否按约定生效。\n\n| 验收项     | 检查方法                                       | 常见失败                                |\n| ---------- | ---------------------------------------------- | --------------------------------------- |\n| 商品一致性 | 逐镜头核对颜色、比例、杯盖、按键和透明杯体     | 杯体变高、按钮消失、出现第二件商品      |\n| 动作正确性 | 对照视频 1 检查顺序和速度，不要求复刻原片主体  | 参考视频里的杯子、手或厨房被带入        |\n| 声音对应   | 听按键、旋转和镜头截点是否落在同一节奏         | 音乐抢拍、旁白讲了未确认卖点            |\n| 镜头连续性 | 看六段镜头是否每段只完成一个任务               | 同一镜头同时换场景、换动作和换主体      |\n| 交付完整性 | 确认 9:16、26 秒生成片和 4 秒后期信息区能顺接  | 生成 30 秒后又叠加 4 秒，成片变成 34 秒 |\n| 发布边界   | 核对商品描述、人物授权、平台规则和生成内容标识 | 价格、认证、功效或真人素材没有授权      |\n\n![](https:\u002F\u002Foss.jeekmind.com\u002Fcarimg\u002F09b5fa\u002F2026-09\u002F1\u002F2d79d2af8cc419b3.png)\n\n图片：阿里云百炼Wan 3.0官方发布页公开用例视频\n\n商品一致性排在第一位。商品不一致时，先回查图 1 是否真的是唯一外观来源，再检查视频参考有没有把原商品带进来。不要把问题直接归因于模型画质。\n\n## 九、出现商品漂移、人物变化和音画错位时怎么返工\n\n返工要回到对应的输入层，不要第一轮就重写整条 Prompt。\n\n商品颜色或比例漂移时，先删除与图 1 冲突的商品图。图 2 只保留局部结构，不再声明完整外观；视频参考补上“不参考原商品外观”。如果商品仍然变化，缩短单段时长，把复杂动作拆开。\n\n出现人物或手部异常时，检查是否同时使用了人物图、手部参考和带人物的视频参考。没有必要的发言人物就删掉身份参考，保留图 3 的握持关系即可。涉及真人图像时，只能使用已经获得授权的素材。\n\n动作对但镜头太乱时，缩小参考视频的职责，只保留动作顺序或运镜其中一项。动作太复杂，就把“拿取—按键—旋转—放回”拆成两个生成任务，再在后期衔接。\n\n音画不一致时，先确认音频到底是声音参考还是后期配乐。音频参考只提供音色、语调或节拍时，Prompt 不要再让它决定剧情。需要精确文案的旁白，最好在后期完成并单独核对。\n\n提交后提示时长或素材组合错误时，按官方限制重新算：代码里最长可生成 30 秒；视频输入总时长加输出时长不超过 30 秒；首尾帧不能和参考图片、参考视频、参考音频同时使用；文件与网页链接二选一。\n\n## 十、素材较多时，怎样把策划、生成和交付记录接起来\n\n商品图、动作样片和音轨都会有多个版本。团队最常卡在版本对应关系：图 1、视频 1 和音频 1 分别指哪份文件，返工后又把旧版本重新上传。\n\n如果当前工作流已经有一组商品素材和目标平台，缺的是素材整理、脚本与生成任务的串联，**[技灵AI营销助手](https:\u002F\u002Fwww.jeekmind.com\u002F)**的视频解析可以拆解参考视频的脚本与镜头，智能策划可以组织商品资料和分镜，视频生成中列有 Wan 3.0 等模型，无限画布适合继续组织图片、视频和音频节点。具体可用模型、规格和权益以产品页面为准。\n![](https:\u002F\u002Foss.jeekmind.com\u002Fcarimg\u002F09b5fa\u002F2026-09\u002F1\u002Fd5fbb3aa45e535d6.png)\n\n\n它不会替品牌确认商品外观、卖点事实、人物授权和投放合规。图 1 的商品结构、视频 1 的使用权、音频 1 的版权和后期字幕，仍要在提交前由业务侧核对。\n\n先选一个 SKU，只保留一张商品外观主图、一张细节图和一张使用关系图；准备一段 4 秒动作参考、一段 8 秒节奏参考；按“26 秒生成片 + 4 秒后期收尾”跑第一条，再对照验收表决定是缩短动作、删除冲突素材，还是切换到 30 秒直出路线。这样比一次上传十几份素材，更容易知道问题到底出在哪一层。","https:\u002F\u002Foss.jeekmind.com\u002Fcarimg\u002F09b5fa\u002F2026-09\u002F21\u002F571a67423932faa4.png","2026-09-20 10:58:09",1789887055404]