中文

HandsOnVLM:用于手-物交互预测的视觉-语言模型

计算机视觉与模式识别 2024-12-19 v2 机器学习

摘要

给定以自然语言形式的高级口语任务规范,我们如何预测场景中人手未来的交互轨迹?在本文中,我们将经典的手部轨迹预测任务扩展为涉及显式或隐式语言查询的两个任务。我们提出的任务要求对人类日常活动有广泛的理解,并具备根据当前场景线索推断接下来应发生什么的能力。我们还开发了新的基准来评估所提出的两个任务:基础手部预测(VHP)和基于推理的手部预测(RBHP)。我们通过将视觉-语言模型(VLM)的高级世界知识与推理能力,与低层以自我为中心的手部轨迹的自回归特性相结合,来实现这些任务的求解。我们的模型 HandsOnVLM 是一种新颖的 VLM,能够通过自然语言对话生成文本响应并产生未来的手部轨迹。实验表明,HandsOnVLM 在所提出的任务上优于现有的特定任务方法及其他 VLM 基线,并展示了其有效利用世界知识根据提供的上下文对低层人类手部轨迹进行推理的能力。我们的网站包含代码和详细的视频结果 https://www.chenbao.tech/handsonvlm/

关键词

引用

@article{arxiv.2412.13187,
  title  = {HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction},
  author = {Chen Bao and Jiarui Xu and Xiaolong Wang and Abhinav Gupta and Homanga Bharadhwaj},
  journal= {arXiv preprint arXiv:2412.13187},
  year   = {2024}
}

备注

Preprint. Under Review