中文

利用外视视频-语言数据解锁自我中心视频表示学习

计算机视觉与模式识别 2024-08-08 v1 计算与语言

摘要

我们提出了EMBED(Egocentric Models Built with Exocentric Data),一种旨在将外视视频-语言数据转换为自我中心视频表示学习的方法。大规模外视数据涵盖了多样化的活动,具有显著的自我中心学习潜力,但自我中心与外视数据之间的固有差异使得无缝利用一种视角进行另一种视角的学习面临挑战。自我中心视频主要呈现近距离的手-物交互,而外视视频则提供对人类活动的更广阔视角。此外,自我中心数据集中的叙述通常更以动作为中心并与视觉内容紧密关联,而外视数据集中的叙述风格则有所不同。为应对这些挑战,我们采用了一种数据转换框架,将外视数据适配为自我中心训练,重点识别强调手-物交互的特定视频片段,并转换叙述风格以契合自我中心视角。通过同时应用视觉和语言风格迁移,我们的框架从外视视频-语言数据中创建了一个新的自我中心数据集。通过广泛的评估,我们证明了EMBED的有效性,在各种自我中心下游任务上取得了最先进的结果,包括在Epic-Kitchens-100多实例检索上绝对提升4.7%,以及在零样本设置下EGTEA分类基准上提升6.2%。此外,EMBED使自我中心视频-语言模型能够在外视任务上具有竞争力。最后,我们展示了EMBED在各种外视数据集上的应用,在应用于不同外视数据集时表现出强大的泛化能力。

关键词

引用

@article{arxiv.2408.03567,
  title  = {Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning},
  author = {Zi-Yi Dou and Xitong Yang and Tushar Nagarajan and Huiyu Wang and Jing Huang and Nanyun Peng and Kris Kitani and Fu-Jen Chu},
  journal= {arXiv preprint arXiv:2408.03567},
  year   = {2024}
}