Audio-3DVG:统一的音频-点云融合用于3D视觉定位
机器学习
2025-08-14 v2 人工智能
计算机视觉与模式识别
机器人学
摘要
3D视觉定位(3DVG)涉及根据自然语言在3D点云中定位目标对象。虽然先前的工作已通过文本描述取得了一些进展,但利用已知语言(即音频)的3D视觉定位仍未得到充分探索且具有挑战性。受自动语音识别(ASR)和语音表示学习进展的启发,我们提出Audio-3DVG,一个简单而有效的框架,将音频与空间信息融合以实现更好的定位。我们不将语音作为单一输入,而是将任务分解为两个互补的组件。首先,我们引入(i)对象指及检测(Object Mention Detection),这是一项多标签分类任务,显式识别音频中提及哪些对象,从而实现更结构化的音频-场景推理。其次,我们提出(ii)音频导向注意力模块(Audio-Guided Attention),建模目标候选对象与被提及对象之间的相互作用,以增强在杂乱3D环境中的辨识能力。为支持基准测试,我们(iii)为标准3DVG数据集(包括 ScanRefer、Sr3D 和 Nr3D)合成音频描述。实验结果表明,Audio-3DVG不仅在音频-based定位中取得了新的状态-of-the-art 性能,还与文本-based方法保持竞争力,凸显了将语音语言整合到3D视觉任务中的潜力。
引用
@article{arxiv.2507.00669,
title = {Audio-3DVG: Unified Audio -- Point Cloud Fusion for 3D Visual Grounding},
author = {Duc Cao-Dinh and Khai Le-Duc and Anh Dao and Bach Phan Tat and Chris Ngo and Duy M. H. Nguyen and Nguyen X. Khanh and Thanh Nguyen-Tang},
journal= {arXiv preprint arXiv:2507.00669},
year = {2025}
}
备注
Preprint, 51 pages