FingerCap:细粒度手指级手部动作描述
计算机视觉与模式识别
2025-11-24 v1
摘要
理解细粒度的人类手部动作是视觉感知、具身智能和多模态交流的基础。在本工作中,我们提出了细粒度手指级手部动作描述 (FingerCap),旨在生成捕捉手部动作细节手指语义的文本描述。为支持这一任务,我们构建了 FingerCap-40K 数据集,包含 40K 组配对的手部动作视频和描述,涵盖两个互补来源:简洁的手指动作指令样式和多样化的自然手部-物体交互。为实现有效评估,我们采用 HandJudge—a 基于大语言模型的评估标准,衡量手指级正确性和动作完整性。时间稀疏性仍是当前视频多模态大语言模型的根本瓶颈,因为稀疏的 RGB 采样不足以捕捉细微的、高频细节动作。作为一种简单且计算友好的补救措施,我们引入 FiGOP (手指组图),将每个 RGB 关键帧与后续手部关键点配对,直到下一个关键帧。一个轻量级时序编码器将关键点转换为动作嵌入,并与 RGB 特征集成。FiGOP 将经典 GOP 概念应用于手指动作,无需增加 RGB 密度即可恢复细粒度时序线索。在 FingerCap-40K 上的实验表明,强大的开源和闭源视频多模态大语言模型在手指级推理方面仍存在挑战,而我们的 FiGOP 增强模型在 HandJudge 和人类研究中均实现了一致的提升。
引用
@article{arxiv.2511.16951,
title = {FingerCap: Fine-grained Finger-level Hand Motion Captioning},
author = {Xin Shen and Rui Zhu and Lei Shen and Xinyu Wang and Kaihao Zhang and Tianqing Zhu and Shuchen Wu and Chenxi Miao and Weikang Li and Yang Li and Deguo Xia and Jizhou Huang and Xin Yu},
journal= {arXiv preprint arXiv:2511.16951},
year = {2025}
}