HanDyVQA:用于捕捉手-物体相互作用动态的细粒度视频问答基准
计算机视觉与模式识别
2025-12-02 v1
摘要
手-物体相互作用(HOI)本质上涉及动态过程,其中人类的操作会对物体产生不同的时空效应。然而,现有的语义HOI基准要么关注操作,要么关注结果效应,且仅在粗粒度层面,缺乏捕捉HOI底层动态的细粒度时空推理能力。我们引入HanDyVQA,这是一个涵盖操作与结果效应两个方面的细粒度视频问答基准。HanDyVQA包含六种互补的问答类型(Action、Process、Objects、Location、State Change和Object Parts),共计1.11万个多选问答对。收集的问答对识别操作风格、手/物体运动以及部件级状态变化。HanDyVQA还包括1.03万个用于Objects和Object Parts问题的分割掩码, enables 对视频物体分割中的物体/部件级推理进行评估。我们对最近的视频基础模型在本基准上进行评估,发现即使是表现最好的模型Gemini-2.5-Pro也仅达到73%的平均准确率,距离人类水平(97%)仍有较大差距。进一步分析显示,在空间关系、运动和部件几何理解方面仍存在挑战。我们还发现,将显式的HOI相关线索整合到视觉特征中可提升性能,为开发更深入理解HOI动态的模型提供了启发。
引用
@article{arxiv.2512.00885,
title = {HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics},
author = {Masatoshi Tateno and Gido Kato and Hirokatsu Kataoka and Yoichi Sato and Takuma Yagi},
journal= {arXiv preprint arXiv:2512.00885},
year = {2025}
}
备注
Project page: https://masatate.github.io/HanDyVQA-project-page/