中文

用于高效四维人类视频生成的跨空间注意力

计算机视觉与模式识别 2025-05-27 v2

摘要

生成可控的全景逼真数字人类视频对于众多应用至关重要。现有方法要么基于采用模板式 3D 表示的方法,要么基于新兴的视频生成模型,但在生成单个或多个数字人类时 suffer from 质量较差、一致性和身份保持有限。本文引入了一种新的跨空间注意力 (ISA) 机制作为现代基于扩散转换器 (DiT) 的视频生成模型的可扩展构建模块。ISA 是一种新的交叉注意力类型,针对人类视频的生成使用相对位置编码。借助开发的自定义视频变异自编码器,我们在大型视频数据语料库上训练了基于 ISA 的潜在扩散模型。我们的模型在 4D 人类视频合成方面实现了最先进的性能,展现出惊人的运动一致性和身份保持能力,同时提供对相机和身体姿态的精确控制。我们的代码和模型已公开发布于 https://dsaurus.github.io/isa4d/。

关键词

引用

@article{arxiv.2505.15800,
  title  = {Interspatial Attention for Efficient 4D Human Video Generation},
  author = {Ruizhi Shao and Yinghao Xu and Yujun Shen and Ceyuan Yang and Yang Zheng and Changan Chen and Yebin Liu and Gordon Wetzstein},
  journal= {arXiv preprint arXiv:2505.15800},
  year   = {2025}
}

备注

Project page: https://dsaurus.github.io/isa4d/