GeoNVS:基于几何引导的视频扩散用于新视角合成
计算机视觉与模式识别
2026-03-17 v1
摘要
新视角合成需要强大的3D几何一致性以及在多样化视角间生成视觉连贯图像的能力。虽然最近的摄像机控制视频扩散模型显示出有前景的成果,但它们常常 suffer于几何畸变和有限的摄像机可控性。为克服这些挑战,我们引入 GeoNVS,一种几何 grounding 的新视角合成器,通过显式3D几何引导来增强几何保真度和摄像机可控性。我们的关键创新是高斯光点特征适配器(GS-Adapter),它将输入视角的扩散特征提升到3D高斯表示中,渲染几何受约束的新视角特征,并自适应地与扩散特征融合,以纠正几何不一致的表示。与先前方法在输入层注入几何信息不同,GS-Adapter 在特征空间中工作,避免了视角相关的颜色噪声导致的结构一致性下降。其即插即用设计使其能够与多样化的前馈几何模型实现零样本兼容,无需额外训练,可适配其他视频扩散 backbone。跨9个场景和18种设置的实验表明,GeoNVS 实现了领先性能,相较 SEVA 和 CameraCtrl 提升了11.3% 和 14.9%,在平移误差上最高可降低2倍,在 Chamfer Distance 上降低7倍。
引用
@article{arxiv.2603.14965,
title = {GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis},
author = {Minjun Kang and Inkyu Shin and Taeyeop Lee and Myungchul Kim and In So Kweon and Kuk-Jin Yoon},
journal= {arXiv preprint arXiv:2603.14965},
year = {2026}
}
备注
The code will be available at https://sites.google.com/view/minjun-kang/geonvs-arxiv26