阿里巴巴的视频生成模型 Wan3.0 已进入公测阶段。相比前代Wan2.5,新模型生成的视频时长翻倍,最长可达30秒,且输入形式大幅扩展——除了常规的文字和图片,PDF文档、网页链接和PowerPoint演示文稿都能直接作为素材,生成动态视频内容。 输入方式更灵活,一次可混搭多种素材 Wan3.0在输入端做了明显升级,支持文本、图像、视频和音频的同步处理。单次提示词最多可包含 十张图片、五段视频和五段音频 。网页和文档类输入也被纳入支持范围,静态的PDF或PPT内容可以直接转化为动态画面,这为营销物料制作、培训视频生成等场景提供了更低的创作门槛。 模型还会根据用户输入的提示词,主动推荐最合适的视频时长,并附带一个视频延长工具,方便在已有片段基础上继续扩展内容。 针对AI视频常见痛点做了优化 AI生成视频普遍存在画面漂移和失真问题,人脸和用户界面(UI)部分尤其明显。阿里方面表示,Wan3.0的改进方向是让参考素材中的角色、道具和空间布局等细节在生成过程中保持更高的一致性,从而减少这类视觉瑕疵。 不过,这一效果目前仍属于官方描述,实际表现如何,还需要等更多用户上手测试后才能验证。 两种版本可选,标准版目前有折扣 Wan3.0的入口包括 wan.video官网 、 阿里云百炼平台(Model Studio) ,以及通过 Qwen Cloud的API 调用。服务分为两个档位:标准版(Standard)当前提供七折优惠,另有速度更快的Prime版本可供选择。 应用场景从影视制作延伸到机器人训练 阿里对Wan3.0的定位覆盖了多个行业方向。影视制作流程有望提速,短剧和社交媒体短视频创作者也能借助它批量产出内容。企业端可以将文字和图片素材转化为营销视频或员工培训材料。技术开发层面,Wan3.0生成的仿真画面可用于训练自动驾驶系统和机器人,为这些领域提供更接近真实环境的模拟数据。 发布节点正值阿里AI投入高峰期 Wan3.0的推出时间点值得注意。阿里刚刚宣布了港股上市公司中规模最大的一次股票配售,募资明确用于AI方向的持续投入。就在上周,公司财报显示季度利润同比下滑75%,主要原因正是AI相关投资大幅增加。一边是模型能力的快速迭代,一边是巨额资金持续注入,阿里在AI视频这条赛道上的打法显然不是试探性的。 对于内容创作者和企业用户来说,Wan3.0目前最值得关注的点在于:输入形式的自由度确实变高了,文档直接转视频的能力如果稳定,可能会改变一部分人的工作流。至于生成质量能否达到官方宣称的水平,还需要实际测试来检验。 特别