Cross3DVG:基于不同RGB-D扫描的跨数据集三维视觉定位
计算机视觉与模式识别
2024-02-08 v3
摘要
我们提出了一种新颖的跨数据集三维场景视觉定位任务(Cross3DVG),它克服了现有三维视觉定位模型的局限性,特别是其受限的三维资源以及由此产生的对特定三维数据集过拟合的倾向。我们创建了RIORefer,一个大规模三维视觉定位数据集,以促进Cross3DVG。它包含来自3RScan的1380个室内RGB-D扫描中超过63k条对三维物体的多样化描述,并带有人类标注。在使用源三维视觉定位数据集训练Cross3DVG模型后,我们在无目标标签的情况下使用目标数据集对其进行评估,目标数据集具有例如不同的传感器、三维重建方法和语言标注者。我们使用已有的视觉定位模型以及基于CLIP的多视角2D与3D融合(旨在弥合三维数据集间的差距)进行了全面实验。对于Cross3DVG任务,(i)由于跨数据集的三维数据与语言变体,跨数据集三维视觉定位的性能显著差于在单一数据集上学习与评估。此外,(ii)更好的目标检测器与定位模块以及融合三维数据与多视角基于CLIP的图像特征可以缓解这一较低性能。我们的Cross3DVG任务可提供一个基准,用于开发鲁棒的三维视觉定位模型以处理多样化三维场景,同时利用深层语言理解。
引用
@article{arxiv.2305.13876,
title = {Cross3DVG: Cross-Dataset 3D Visual Grounding on Different RGB-D Scans},
author = {Taiki Miyanishi and Daichi Azuma and Shuhei Kurita and Motoki Kawanabe},
journal= {arXiv preprint arXiv:2305.13876},
year = {2024}
}
备注
3DV 2024