wan 3.0 使用指南:从文字或首帧图片生成视频
在 Yix 使用 wan 3.0 生成视频:了解文字与首帧图片两种输入方式、2–30 秒时长、分辨率和积分,附可直接修改的镜头提示词与成片检查方法。

wan 3.0 可以把文字描述或一张首帧图片生成视频。在 Yix 中,时长可选 2–30 秒,分辨率有 480p、720p 和 1080p。当前生成的是无声片段,需要旁白或音乐时,可在剪辑软件里补上。
打开 wan 3.0 视频生成器 即可选中模型。本文用咖啡杯镜头说明参数怎么选、提示词怎么改。封面为 AI 生成的教程示意图,不是该模型的视频输出截图。
wan 3.0 支持哪些设置
阿里巴巴的模型介绍列出了文字、图片输入、最高 1080p 和三十秒输出上限。本文只讲 Yix 当前的文字和单图工作流,以下设置于 2026 年 9 月 10 日核对。
| 设置 | Yix 中的用法 |
|---|---|
| 输入 | 文字,或一张图片加文字 |
| 时长 | 2–30 秒,按整秒选择 |
| 分辨率 | 480p、720p、1080p |
| 纯文字画幅 | 自适应、16:9、9:16、1:1、4:3、3:4 |
| 图片画幅 | 沿用首帧图片比例 |
| 声音 | 无声输出 |
时长应该由动作决定。咖啡杯上方飘一点蒸汽,五秒就能表达;直接拉到三十秒,会增加积分消耗,也需要检查更长的画面。
先用文字做一个短镜头
选择 wan 3.0,暂时不上传图片,设为五秒、480p、16:9。可以从这段原创练习提示词开始:
一只象牙白陶瓷咖啡杯放在木质咖啡桌上,旁边是有雨痕的窗户。细薄蒸汽缓慢升起,杯子保持不动。镜头缓慢向前推进,全程保留完整杯身。室内暖光,窗外冷色天光。单个连续镜头,不切换场景,不增加物品或文字。
这里把杯子的动作和镜头的动作分开了。如果推进太明显,下次只把镜头那句改成“固定机位,不推拉、不摇移”,其他描述保持一致,更容易看出改动的影响。这些是练习建议,不代表每次都能得到相同结果。
用首帧图片控制起始画面
上传小于 10 MB 的 JPG、PNG 或 WebP 图片。先把图片裁成最终想要的比例:竖图生成时沿用竖图比例,不能靠选择横屏选项把它变宽。
已有咖啡杯照片时,wan 3.0 提示词应着重写运动:
以这张图片为起始画面。杯子和桌面保持静止,只有少量蒸汽缓慢升起。镜头轻微推进,全程保留完整杯身。保持原有光线和背景布局,不切镜,不出现手,不增加物品。
首帧不等于后续每帧都被锁定。检查杯柄、杯口和印花有没有变化。商品素材可先在 Product Studio 整理静态画面;商品摄影提示词指南介绍了如何让包装文字保持可读。
wan 3.0 需要多少积分
按当前 Yix 计费规则,同样生成五秒视频,480p 为 180 积分,720p 为 380 积分,1080p 为 760 积分;两秒 480p 为 80 积分。文字和首帧图片输入使用相同费率。
模型配置默认为五秒、1080p,但从其他模型切换时,兼容的参数可能保留。每次以生成按钮附近的报价为准,积分套餐可在价格页查看。用低分辨率确认运动,再生成高分辨率版本,会产生新的视频和新的一次扣费,并非给原片无损提高清晰度。
看完整段,再决定下载
用 wan 3.0 做复杂场景时,先让一个镜头完成一个动作。人物走进房间、拿起商品、转身并展示标签,适合拆成几个片段后剪辑。提高分辨率不能替代明确的动作描述。
成片后检查开头、中间和结尾,留意主体变形、背景跳动、意外切镜或出框。满意后下载,并保留原图和提示词,方便之后修改。如果需要同步对白,可以参考 Seedance 使用指南。回到 wan 3.0 生成器,从一个短而明确的动作开始即可。