面向非主观助理人的视觉意图 grounding
计算机视觉与模式识别
2025-04-21 v1
摘要
视觉 grounding 将文本描述与图像中的对象关联。常规方法针对第三人称图像输入和命名对象查询。在诸如AI助理等应用中,视角会发生变化——输入为非主观,且对象可能通过需求和意图被隐式地指代。为弥合这一差距,我们引入EgoIntention,即首个针对非主观视觉意图 grounding 的数据集。EgoIntention挑战多模态大语言模型(LLM)以1)理解并忽略意图无关的上下文对象,2)推理关于不常见对象功能的情形。基准结果表明,当前模型误识别上下文对象,缺乏非主观视图中的功能理解。我们还提出了Reason-to-Ground(RoG)指令调优;它实现了正常描述与非主观意图的混合训练,采用链式意图推理与对象 grounding 机制。RoG在EgoIntention数据集上显著优于朴素微调和混合训练,同时保持或略微改进朴素描述 grounding。此突破实现了对非主观和外观性视觉输入的统一视觉 grounding,同时处理显式对象查询和隐式人类意图。
关键词
引用
@article{arxiv.2504.13621,
title = {Visual Intention Grounding for Egocentric Assistants},
author = {Pengzhan Sun and Junbin Xiao and Tze Ho Elden Tse and Yicong Li and Arjun Akula and Angela Yao},
journal= {arXiv preprint arXiv:2504.13621},
year = {2025}
}