CausNVS:基于因果掩码的自回归多视角扩散用于灵活 3D 新视角合成
计算机视觉与模式识别
2025-09-09 v1
摘要
多视角扩散模型在 3D 新视角合成方面显示出前景,但大多数现有方法采用非自回归形式,限制了其在世界建模中的适用性,因为它们仅支持固定数量的视角,且因同步去噬所有帧而推理速度较慢。为此,我们提出 CausNVS,一种在自回归设置下的多视角扩散模型,支持任意输入-输出 视角配置并按顺序生成视角。我们采用因果掩码和逐帧噪声训练 CausNVS,利用成对-相对相机姿态编码(CaPE)实现精确的相机控制。在推理时,我们结合空间感知滑动窗口、键值缓存和噪声条件增强,以缓解漂移。我们的实验表明,CausNVS 支持广泛的相机轨迹,实现了灵活的自回归新视角合成,在多种设置下始终保持优异的视觉质量。项目页面:https://kxhit.github.io/CausNVS.html。
引用
@article{arxiv.2509.06579,
title = {CausNVS: Autoregressive Multi-view Diffusion for Flexible 3D Novel View Synthesis},
author = {Xin Kong and Daniel Watson and Yannick Strümpler and Michael Niemeyer and Federico Tombari},
journal= {arXiv preprint arXiv:2509.06579},
year = {2025}
}