你看见我指的什么?基于手势的体视角视频问答
计算机视觉与模式识别
2026-03-31 v2
摘要
理解和回答基于用户指向手势的问题对于下一代体视角AI助手至关重要。然而,当前的多模态大语言模型(MLLM)在这类任务上难以应对,原因在于缺乏手势丰富的数据以及其有限的从体视角视频中推断细粒度指向意图的能力。为此,我们引入EgoPointVQA,一个用于手势导向体视角问答的数据集和基准,包含4000个合成视频和400个真实世界视频,覆盖多个指指推理任务。基于此,我们进一步提出Hand Intent Tokens(HINT),通过离线重建模型从3D手部关键点生成编码化符号,并交错插入模型输入中,以提供解释指向意图的明确空间和时间上下文。我们展示了我们的模型在不同背bone和模型规模上均优于其他模型。特别地,HINT-14B在6个任务上的平均准确率达到68.1%,超越最新进展InternVL3-14B 6.6%。为进一步促进开放研究,我们将发布代码、模型和数据集。项目页面: https://yuuraa.github.io/papers/choi2026egovqa
引用
@article{arxiv.2603.12533,
title = {Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering},
author = {Yura Choi and Roy Miles and Rolandos Alexandros Potamias and Ismail Elezi and Jiankang Deng and Stefanos Zafeiriou},
journal= {arXiv preprint arXiv:2603.12533},
year = {2026}
}
备注
Accepted to CVPR 2026