ANNEXE:统一的以动作为导向的交互分析、回答与像素定位
计算机视觉与模式识别
2025-04-03 v1
摘要
以动作为导向的交互感知是人类-环境交互研究中的一个重要分支,为开发下一代智能系统奠定了基础。然而,现有的以动作为导向的交互理解方法无法同时根据用户查询生成连贯的文本和像素级响应,这在满足不同下游应用需求方面缺乏灵活性。为全面理解以动作为导向的交互,本文提出了一种新任务,即以动作为导向的交互推理与像素定位(Ego-IRG)。以带查询的以动作为导向图像为输入,Ego-IRG是首个旨在通过三个关键步骤(分析、回答和像素定位)来解决交互问题的任务,从而生成流畅的文本和细粒度的像素级响应。另一个挑战在于,现有数据集无法满足Ego-IRG任务的条件。为此,本文基于大量人工工作创建了Ego-IRGBench数据集,包含超过2万张以动作为导向的图像,涵盖160万条查询及其关于交互的多模态响应。此外,我们设计了统一的ANNEXE模型,利用多模态大型语言模型生成文本和像素级输出,实现对以动作为导向的交互的全面解释。在Ego-IRGBench上的实验表明,ANNEXE模型在与其他方法相比方面具有有效性。
引用
@article{arxiv.2504.01472,
title = {ANNEXE: Unified Analyzing, Answering, and Pixel Grounding for Egocentric Interaction},
author = {Yuejiao Su and Yi Wang and Qiongyang Hu and Chuang Yang and Lap-Pui Chau},
journal= {arXiv preprint arXiv:2504.01472},
year = {2025}
}
备注
Computer Vision and Pattern Recognition