面向单目三维视觉定位的三维视觉-语言感知双重增强
计算机视觉与模式识别
2025-08-27 v1
摘要
单目三维视觉定位是一项新颖的任务,旨在利用包含显式几何信息的文本描述,在RGB图像中定位三维物体。尽管文本中包含了几何细节,但我们观察到文本嵌入对数值的大小敏感,却在很大程度上忽略了相关的度量单位。例如,将带有单位“米”的长度简单地等距映射为“分米”或“厘米”会导致严重的性能下降,即使物理长度是等价的。这一观察结果表明预训练语言模型的三维理解能力较弱,会产生误导性的文本特征,从而阻碍三维感知。因此,我们提出通过两种简单有效的方法来增强模型在文本嵌入和几何特征上的三维感知能力。首先,我们引入一种名为三维文本增强(3DTE)的预处理方法,该方法通过增强文本查询中距离描述符的多样性,来增强对不同单位之间映射关系的理解。其次,我们提出了一个文本引导的几何增强(TGE)模块,通过将基础文本特征投影到几何一致的空间中,进一步增强了三维文本信息。这些经过三维增强的文本特征随后被用来精确引导几何特征的注意力。我们在Mono3DRefer数据集上通过广泛的比较和消融研究对所提出的方法进行了评估。实验结果表明,与先前方法相比,性能有了显著提升,在“远距离”场景下取得了11.94%的显著准确率增益,达到了新的最优水平。我们的代码将公开发布。
引用
@article{arxiv.2508.19165,
title = {Dual Enhancement on 3D Vision-Language Perception for Monocular 3D Visual Grounding},
author = {Yuzhen Li and Min Liu and Yuan Bian and Xueping Wang and Zhaoyang Li and Gen Li and Yaonan Wang},
journal= {arXiv preprint arXiv:2508.19165},
year = {2025}
}
备注
10 pages