中文

HanDyVQA:用于捕捉手-物体相互作用动态的细粒度视频问答基准

计算机视觉与模式识别 2025-12-02 v1

摘要

手-物体相互作用(HOI)本质上涉及动态过程,其中人类的操作会对物体产生不同的时空效应。然而,现有的语义HOI基准要么关注操作,要么关注结果效应,且仅在粗粒度层面,缺乏捕捉HOI底层动态的细粒度时空推理能力。我们引入HanDyVQA,这是一个涵盖操作与结果效应两个方面的细粒度视频问答基准。HanDyVQA包含六种互补的问答类型(Action、Process、Objects、Location、State Change和Object Parts),共计1.11万个多选问答对。收集的问答对识别操作风格、手/物体运动以及部件级状态变化。HanDyVQA还包括1.03万个用于Objects和Object Parts问题的分割掩码, enables 对视频物体分割中的物体/部件级推理进行评估。我们对最近的视频基础模型在本基准上进行评估,发现即使是表现最好的模型Gemini-2.5-Pro也仅达到73%的平均准确率,距离人类水平(97%)仍有较大差距。进一步分析显示,在空间关系、运动和部件几何理解方面仍存在挑战。我们还发现,将显式的HOI相关线索整合到视觉特征中可提升性能,为开发更深入理解HOI动态的模型提供了启发。

关键词

引用

@article{arxiv.2512.00885,
  title  = {HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics},
  author = {Masatoshi Tateno and Gido Kato and Hirokatsu Kataoka and Yoichi Sato and Takuma Yagi},
  journal= {arXiv preprint arXiv:2512.00885},
  year   = {2025}
}

备注

Project page: https://masatate.github.io/HanDyVQA-project-page/