单图即多模态,足以实现新视角合成
计算机视觉与模式识别
2026-04-20 v2
摘要
扩散方法最近在单图新视角合成中表现出强大的性能, 通过对单眼深度估计推断的几何信息对生成模型进行条件化。然而,实际应用中,合成视角的质量和一致性,受限于深度估计的可靠性,这些深度估计在低纹理、恶劣天气和遮挡严重的真实场景下常常脆弱可靠。本文我们表明,引入稀疏多模态范围测量,提供一种简单而有效的方式来克服这些限制。我们引入一种多模态深度重建框架,利用极其稀疏的范围感测数据(如汽车雷达或激光测距仪),生成密集深度图,作为基于扩散的方法的新视角合成的稳健几何条件。我们的 方法在角度域中对深度进行建模,采用局部高斯过程公式,实现计算效率的推断,同时在观测有限的区域中显式量化不确定性。重建后的深度和不确定性可作为单眼深度估计器的即插即用替换品,无需修改生成模型本身。实验在真实的多模态驾驶场景中表明,用我们的稀疏范围基重建取代视觉单一深度, 在单图新视角视频生成中显著提高了几何一致性和视觉质量。这些结果凸显了可靠几何先验对基于扩散的视角合成的重要性, 并展示了即使在极端稀疏水平下,多模态感知的实际优势。代码已公开:https://github.com/importAmir/MultiModalNVS
引用
@article{arxiv.2602.17909,
title = {A Single Image and Multimodality Is All You Need for Novel View Synthesis},
author = {Amirhosein Javadi and Chi-Shiang Gau and Konstantinos D. Polyzos and Tara Javidi},
journal= {arXiv preprint arXiv:2602.17909},
year = {2026}
}