中文

POV:面向多视角世界的自我中心手-物交互的提示导向视角无关学习

计算机视觉与模式识别 2024-03-12 v1

摘要

我们人类善于将手-物交互(HOI)的第三人称观察转化为自我中心视角。然而,当前方法难以复现这种从第三人称到第一人称的视角适应能力。尽管一些方法尝试从大规模视频数据集中学习视角无关表示,但它们忽略了多个第三人称视角之间的关系。为此,我们在本文中提出了一种面向提示的视角无关学习(POV)框架,该框架仅需少量自我中心视频即可实现这种视角适应。具体而言,我们在帧级别引入交互掩码提示以捕获细粒度的动作信息,并在 token 级别引入视角感知提示以学习视角无关表示。为了验证我们的方法,我们建立了两个用于从多个第三人称视角向自我中心视角迁移的基准。我们在这些基准上的大量实验证明了我们的 POV 框架和提示微调技术在视角适应和视角泛化方面的有效性和高效性。我们的代码可在 \url{https://github.com/xuboshen/pov_acmmm2023} 获取。

关键词

引用

@article{arxiv.2403.05856,
  title  = {POV: Prompt-Oriented View-Agnostic Learning for Egocentric Hand-Object Interaction in the Multi-View World},
  author = {Boshen Xu and Sipeng Zheng and Qin Jin},
  journal= {arXiv preprint arXiv:2403.05856},
  year   = {2024}
}

备注

Accepted by ACM MM 2023. Project page: https://xuboshen.github.io/