超越对象类别:多属性参考理解的视觉 grounding
计算机视觉与模式识别
2025-03-26 v1 人机交互
摘要
指代表达理解(REC)旨在实现基于自然语言描述的对象定位。然而,现有的REC方法受限于对象类别描述和单属性意图描述,限制了其在现实场景中的应用。在自然的人机交互中,用户常通过 individual states and intentions,伴随引导手势,而非详细的对象描述来表达其愿望。为此,我们提出了Multi-ref EC,一种将状态描述、派生意图和具身手势整合以定位目标对象的新任务框架。我们引入State-Intention-Gesture Attributes Reference(SIGAR)数据集,组合状态和意图表达与具身参考。通过在SIGAR上对各种基线模型进行大量实验,我们证明了properly ordered的多属性参考对改进定位性能有积极影响,揭示了单属性参考在自然人机交互场景中不足之处。我们的发现凸显了多属性参考表达在推动视觉-语言理解方面的重要性。
引用
@article{arxiv.2503.19240,
title = {Beyond Object Categories: Multi-Attribute Reference Understanding for Visual Grounding},
author = {Hao Guo and Jianfei Zhu and Wei Fan and Chunzhi Yi and Feng Jiang},
journal= {arXiv preprint arXiv:2503.19240},
year = {2025}
}