HOI-Ref:自我中心视觉中的手物交互指代
计算机视觉与模式识别
2024-04-16 v1
摘要
大型视觉语言模型目前已成为包括视觉问答、物体识别和空间指代在内的多项任务事实上的最先进技术。在这项工作中,我们提出了针对自我中心图像的 HOI-Ref 任务,旨在使用 VLMs 理解手与物体之间的交互。为了实现 HOI-Ref,我们构建了 HOI-QA 数据集,其中包含用于训练和评估 VLMs 的 390 万个问答对。HOI-QA 包含与定位手、物体及其关键交互相关的问题(例如,指代正被手操纵的物体)。我们在该数据集上训练了首个用于 HOI-Ref 的 VLM,并将其称为 VLM4HOI。我们的结果表明,针对第三人称图像指代训练的 VLMs 无法识别和指代自我中心图像中的手和物体。在我们的自我中心 HOI-QA 数据集上进行微调后,指代手和物体的性能提升了 27.9%,指代交互的性能提升了 26.7%。
引用
@article{arxiv.2404.09933,
title = {HOI-Ref: Hand-Object Interaction Referral in Egocentric Vision},
author = {Siddhant Bansal and Michael Wray and Dima Damen},
journal= {arXiv preprint arXiv:2404.09933},
year = {2024}
}
备注
Project Page: https://sid2697.github.io/hoi-ref/