中文

CATSplat:面向单视图图像可泛化三维高斯泼溅的上下文感知Transformer与空间引导

计算机视觉与模式识别 2025-02-04 v2

摘要

近年来,基于三维高斯泼溅的可泛化前馈方法因其利用有限资源重建三维场景的潜力而受到广泛关注。这些方法通过单次前向传播,仅从少量图像中创建由逐像素三维高斯原语参数化的三维辐射场。然而,与受益于跨视图对应关系的多视图方法不同,单视图图像的三维场景重建仍是一个未充分探索的领域。在这项工作中,我们引入了CATSplat,一种新颖的可泛化Transformer框架,旨在突破单目设置中的固有约束。首先,我们提出利用视觉语言模型的文本引导来补充单张图像中不足的信息。通过跨注意力机制将文本嵌入中的场景特定上下文细节融入,我们为超越仅依赖视觉线索的上下文感知三维场景重建铺平了道路。此外,我们主张利用三维点特征的空间引导,以实现单视图设置下的全面几何理解。借助三维先验,图像特征能够捕获丰富的结构信息,从而无需多视图技术即可预测三维高斯。在大规模数据集上的大量实验表明,CATSplat在单视图三维场景重建中实现了最先进的性能,并生成了高质量的新视角合成。

关键词

引用

@article{arxiv.2412.12906,
  title  = {CATSplat: Context-Aware Transformer with Spatial Guidance for Generalizable 3D Gaussian Splatting from A Single-View Image},
  author = {Wonseok Roh and Hwanhee Jung and Jong Wook Kim and Seunggwan Lee and Innfarn Yoo and Andreas Lugmayr and Seunggeun Chi and Karthik Ramani and Sangpil Kim},
  journal= {arXiv preprint arXiv:2412.12906},
  year   = {2025}
}