中文

面向以太视角视频表示学习的手-物体细粒度动力学建模

计算机视觉与模式识别 2025-03-04 v1

摘要

在以太视角视频理解中,手部与物体的运动以及它们之间的相互作用在本质上发挥着重要作用。然而,现有的以太视角视频表示学习方法主要关注将视频表示与高层叙述对齐,忽略了手部与物体之间复杂的动力学。本文旨在将手-物体细粒度动力学建模集成到视频表示学习过程中。由于缺乏合适的数据,我们引入了 HOD,这一新型管道,采用手-物体检测器和大语言模型生成包含手-物体动力学详细描述的高质量叙述。为学习这些细粒度动力学,我们提出了 EgoVideo 模型,配备一种新的轻量级运动适配器,以捕捉手-物体运动信息。通过我们的联合训练策略,EgoVideo 能有效且高效地利用 HOD 数据中的细粒度手-物体动力学。广泛的实验表明,我们的方法在多个以太视角下游任务上实现了最先进的性能,包括在 EK-100 多实例检索中提升 6.3%,在 EK-100 分类中提升 5.7%,以及在 EGTEA 分类中提升 16.3%(零样本设置下)。此外,我们的模型在手-物体相互作用和机器人操控任务中展现出稳健的泛化能力。代码和数据已提供:https://github.com/OpenRobotLab/EgoHOD/。

关键词

引用

@article{arxiv.2503.00986,
  title  = {Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning},
  author = {Baoqi Pei and Yifei Huang and Jilan Xu and Guo Chen and Yuping He and Lijin Yang and Yali Wang and Weidi Xie and Yu Qiao and Fei Wu and Limin Wang},
  journal= {arXiv preprint arXiv:2503.00986},
  year   = {2025}
}

备注

Accepted as ICLR 2025 conference paper