阿里Wan 3.0公测开启:视频生成进入“长叙事”与“多模态”时代

阿里巴巴集团近日正式向公众开放了其新一代视频生成模型——Wan 3.0的测试通道。这标志着AI视频生成技术不再局限于几秒的片段演示,开始向更实用、更具创作深度的应用场景迈进。

核心升级:30秒连贯生成与深度意图理解

与此前版本相比,Wan 3.0最直观的进步是视频时长的突破。模型现在能够单次生成长达30秒的视频内容,这意味着它有能力去讲述一个更完整的小故事或清晰地演示一个复杂流程。更重要的是,其底层逻辑强调对用户创作意图的“完整表达”,而非简单拼凑画面,确保了生成视频在主题和逻辑上的连贯性。

创作入口革命:从文档直接到视频

除了常规的文本、图片、音频和视频输入外,Wan 3.0引入了一项颠覆性的功能:支持文档格式直接输入。用户现在可以将 Word文档、Excel表格、PowerPoint演示文稿、PDF文件甚至Markdown笔记 作为创作素材提交给模型。AI会自动解析文档中的关键信息和结构,并将其转化为视频叙事。这一功能极大降低了视频创作的技术门槛,为教育、商务报告、知识分享等领域带来了全新的内容生产方式。

追求极致真实感:人物与场景的双重进化

在画面质量上,Wan 3.0将“真实可信”作为核心目标。模型在生成人物时能够实现“千人千面”,有效避免了过往AI视频中人物形象重复或僵硬的问题。在场景渲染上,它致力于准确还原真实世界的物理细节和光影效果,力求每一帧画面都经得起推敲,从而提升整体观感的专业度和可信度。

目前,公测的开放意味着更多的开发者和创作者可以亲身体验这一技术,其实际应用效果和潜在的创意可能性,正等待市场的进一步检验。