CityLoc:基于高斯表示的大规模场景文本描述6自由度姿态分布式定位
计算机视觉与模式识别
2025-02-04 v2
摘要
在大规模3D场景中对文本描述进行定位存在内在歧义,例如识别城市中所有红绿灯。为此,我们提出一种方法,生成以文本描述为条件的摄像机姿态分布,以实现对广义概念进行稳健的推理。我们的方法采用基于扩散的架构,将噪声的6DoF摄像机姿态细化至合理位置,条件信号来源于预训练的文本编码器。与预训练的视觉语言模型CLIP集成,建立了文本描述与姿态分布之间的强关联。通过使用3D高斯溅写渲染候选姿态,实现定位精度的提升,该方法通过视觉推理纠正了误alignment的样本。我们通过在五个大规模数据集上与标准分布估计方法进行比较,验证了我们方法的优越性,显示出始终的超越。代码、数据集和更多信息将在我们的项目页面上公开可用。
引用
@article{arxiv.2501.08982,
title = {CityLoc: 6DoF Pose Distributional Localization for Text Descriptions in Large-Scale Scenes with Gaussian Representation},
author = {Qi Ma and Runyi Yang and Bin Ren and Nicu Sebe and Ender Konukoglu and Luc Van Gool and Danda Pani Paudel},
journal= {arXiv preprint arXiv:2501.08982},
year = {2025}
}