WildCAT3D:野外场景下的外观感知多视角扩散
计算机视觉与模式识别
2025-11-04 v2
摘要
尽管在应用于以对象为中心的场景的稀疏新视角合成(NVS)方面取得了近期进展,但场景级别的NVS仍然是一个挑战。一个核心问题是缺乏可用的干净多视角训练数据,除手动策划的数据集外,这些数据集具有有限的多样性、相机变化或许可问题。另一方面,野外存在大量多样且许可宽松的数据,由来自旅游照片等来源的具有不同外观(光照、瞬时遮挡等)的场景组成。为此,我们提出了WildCAT3D,一个从野外捕获的多样化2D场景图像数据学习场景新视角的框架。我们通过显式建模图像中的全局外观条件来解锁对这些数据源的训练,将最先进的多视角扩散范式扩展为从具有不同外观的场景视角中学习。我们的训练模型在推理时泛化到新场景,从而实现多个一致的新视角的生成。WildCAT3D在单视角NVS的对象级别和场景级别设置上提供了最先进的结果,同时使用的数据源严格少于先前方法。此外,它通过在生成过程中提供全局外观控制,实现了新颖的应用。
引用
@article{arxiv.2506.13030,
title = {WildCAT3D: Appearance-Aware Multi-View Diffusion in the Wild},
author = {Morris Alper and David Novotny and Filippos Kokkinos and Hadar Averbuch-Elor and Tom Monnier},
journal= {arXiv preprint arXiv:2506.13030},
year = {2025}
}
备注
Accepted to NeurIPS 2025. Project page: https://wildcat3d.github.io