中文

Yan:基础交互式视频生成框架

计算机视觉与模式识别 2025-08-15 v3 人工智能

摘要

我们提出了Yan,一个用于交互式视频生成的基础框架,覆盖了从模拟、生成到编辑的整个流程。具体来说,Yan包含三个核心模块。AAA级模拟:我们设计了一个高度压缩、低延迟的3D-VAE,并结合基于KV缓存的移位窗口去噪推理过程,实现了实时1080P/60FPS的交互式模拟。多模态生成:我们引入了一种分层自回归字幕方法,将游戏特定知识注入到开放域多模态视频扩散模型(VDM)中,然后将VDM转换为一个逐帧、动作可控、实时无限的交互式视频生成器。值得注意的是,当文本和视觉提示来自不同领域时,该模型展现出强大的泛化能力,使其能够根据用户提示灵活地融合和组合跨领域的风格与机制。多粒度编辑:我们提出了一种混合模型,该模型明确地将交互机制模拟与视觉渲染解耦,从而在交互过程中通过文本实现多粒度的视频内容编辑。总的来说,Yan提供了这些模块的集成,将交互式视频生成从孤立的能力推向一个全面的、由AI驱动的交互式创作范式,为下一代创意工具、媒体和娱乐铺平了道路。项目页面是:https://greatx3.github.io/Yan/。

关键词

引用

@article{arxiv.2508.08601,
  title  = {Yan: Foundational Interactive Video Generation},
  author = {Deheng Ye and Fangyun Zhou and Jiacheng Lv and Jianqi Ma and Jun Zhang and Junyan Lv and Junyou Li and Minwen Deng and Mingyu Yang and Qiang Fu and Wei Yang and Wenkai Lv and Yangbin Yu and Yewen Wang and Yonghang Guan and Zhihao Hu and Zhongbin Fang and Zhongqian Sun},
  journal= {arXiv preprint arXiv:2508.08601},
  year   = {2025}
}