超越语言:以手部指向在环视视野中对指称表达进行 grounding
计算机视觉与模式识别
2026-03-30 v1
摘要
传统的视觉定位(VG)主要依赖文本描述来定位物体,这种范式在语言歧义性方面存在天然困难,往往忽略了现实世界交互中常见的非语言指代线索。在自然的环视参与中,手部指向与语音组合构成最直观的指称机制。为弥合这一差距,我们引入了 EgoPoint-Ground,首个专注于环视指代视觉定位的大规模多模态数据集。数据集包含超过 15k 个复杂场景中的互动样本,提供丰富的多层次注释,包括手部-目标边界框配对和密集语义标题。我们建立了针对手部指向指称表达解析的全面基准,评估了多种主流多模态大语言模型(MLLM)和最新VG架构。进一步,我们提出了 SV-CoT,一种新的基线框架,将定位重新表述为结构化推理过程,通过视觉链式思考范式融合手势和语言线索。大量实验表明,SV-CoT 在现有方法上实现了 11.7% 的绝对提升,有效缓解了语义歧义,推动了智能体理解多模态物理意图的能力。该数据集和代码将公开发布。
引用
@article{arxiv.2603.26646,
title = {Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision},
author = {Ling Li and Bowen Liu and Zinuo Zhan and Peng Jie and Jianhui Zhong and Kenglun Chang and Zhidong Deng},
journal= {arXiv preprint arXiv:2603.26646},
year = {2026}
}