中文

超越对象类别:多属性参考理解的视觉 grounding

计算机视觉与模式识别 2025-03-26 v1 人机交互

摘要

指代表达理解(REC)旨在实现基于自然语言描述的对象定位。然而,现有的REC方法受限于对象类别描述和单属性意图描述,限制了其在现实场景中的应用。在自然的人机交互中,用户常通过 individual states and intentions,伴随引导手势,而非详细的对象描述来表达其愿望。为此,我们提出了Multi-ref EC,一种将状态描述、派生意图和具身手势整合以定位目标对象的新任务框架。我们引入State-Intention-Gesture Attributes Reference(SIGAR)数据集,组合状态和意图表达与具身参考。通过在SIGAR上对各种基线模型进行大量实验,我们证明了properly ordered的多属性参考对改进定位性能有积极影响,揭示了单属性参考在自然人机交互场景中不足之处。我们的发现凸显了多属性参考表达在推动视觉-语言理解方面的重要性。

关键词

引用

@article{arxiv.2503.19240,
  title  = {Beyond Object Categories: Multi-Attribute Reference Understanding for Visual Grounding},
  author = {Hao Guo and Jianfei Zhu and Wei Fan and Chunzhi Yi and Feng Jiang},
  journal= {arXiv preprint arXiv:2503.19240},
  year   = {2025}
}