阿里云近日宣布,其自主研发的全新视频生成模型Wan3.0正式进入公测阶段。作为万相模型家族的第三代产品,该模型历经8个版本的迭代升级,在视频生成时长、创作自由度、参考图复用能力及画面真实感等核心指标上实现突破性进展。
在视频时长方面,Wan3.0将单次生成上限扩展至30秒,较前代产品提升50%。这一突破使得连续运镜、一镜到底等复杂拍摄手法成为可能,创作者得以构建完整叙事链条。配套的智能时长推荐系统可根据文本描述自动匹配最佳视频长度,而视频延伸工具则支持对现有片段进行剧情拓展与镜头补充。针对办公场景需求,模型首次实现跨模态输入,支持doc、xls、ppt、pdf等九种文档格式直接生成视频内容,单个文件或链接最大支持100MB、50页的素材处理。
画面质量提升是本次升级的另一重点。通过优化人像生成算法,模型解决了人物同质化与质感失真问题,现在能够精准呈现五官细节、皮肤纹理及微表情变化。在多人场景中,系统可独立区分每个角色的神态特征。参考图复用功能实现质的飞跃,角色外观、道具结构、空间布局等要素在多角度拍摄中保持高度一致,同时支持电影、纪实等多元影视风格的稳定输出。针对数据可视化需求,模型特别优化了图表类素材的色彩搭配与信息排版,确保视觉效果与数据可读性的平衡。
编辑功能方面,新模型支持对生成视频进行局部修改,包括画面元素调整、剧情逻辑优化及台词修正等精细化操作。开发团队同时坦承,当前版本在音频质量与文字识别精度上仍有改进空间,相关优化工作已纳入后续迭代计划。此次公测将面向特定用户群体开放,收集的反馈数据将直接用于模型性能的持续优化。






















