HandVQA: 诊断和改进视觉语言模型中关于手部的细粒度空间推理
计算机视觉与模式识别
2026-03-30 v1
摘要
理解人类手部的细粒度表达在高风险场景中至关重要,如机器人辅助手术、芯片制造和基于AR/VR的人机交互。尽管在通用视觉语言基准上接近人类表现,当前的视觉语言模型(VLM)在细粒度空间推理方面存在困难,尤其是在解释复杂和关节式手部姿态方面。我们引入HandVQA,一个大规模诊断基准,旨在通过视觉问答评估VLM对手部解剖结构的理解。基于高质量三维手部数据集(FreiHAND、InterHand2.6M、FPHA),我们的基准包含超过160万道受控多项选择题,探测手部关节之间的空间关系,如角度、距离和相对位置。我们使用轻量级LoRA微调,在基线和微调设置下评估了几个最先进的VLM(LLaVA、DeepSeek和Qwen-VL)。我们的发现揭示了当前模型的系统性局限,包括幻觉手指部件、错误的几何解释和泛化能力差。HandVQA不仅暴露了这些关键的推理缺口,还提供了改进的验证路径。我们证明从基准中学习的三维空间知识在零样本设置下迁移,显著提高了模型在新下游任务上的准确率,如手部手势识别(+10.33%)和手-物体交互(+2.63%)。
引用
@article{arxiv.2603.26362,
title = {HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models},
author = {MD Khalequzzaman Chowdhury Sayem and Mubarrat Tajoar Chowdhury and Yihalem Yimolal Tiruneh and Muneeb A. Khan and Muhammad Salman Ali and Binod Bhattarai and Seungryul Baek},
journal= {arXiv preprint arXiv:2603.26362},
year = {2026}
}
备注
Accepted in CVPR 2026; Project page, code, and dataset: https://kcsayem.github.io/handvqa/