中文

检索增强的第一人称视角视频描述

计算机视觉与模式识别 2024-06-21 v4

摘要

从第一人称视角视频中理解人类动作提出了重大挑战。以往的大多数方法仅探索在第一人称视角视频上进行表示学习,而忽略了利用现有的大规模第三人称视角视频的潜在益处。在本文中,(1)我们开发了 EgoInstructor,这是一个检索增强的多模态描述模型,能够自动检索语义相关的第三人称教学视频,以增强第一人称视角视频的视频描述。(2)为了训练跨视角检索模块,我们设计了一个自动流水线,从不同的大规模第一人称和第三人称数据集中发现第一人称-第三人称视频对。(3)我们使用一种新颖的 EgoExoNCE 损失函数训练跨视角检索模块,该损失通过将第一人称和第三人称视频特征对齐到描述相似动作的共享文本特征,拉近两者的距离。(4)通过广泛的实验,我们的跨视角检索模块在七个基准测试中展现出卓越的性能。在第一人称视角视频描述方面,EgoInstructor 通过利用第三人称视频作为参考,取得了显著的改进。项目页面位于:https://jazzcharles.github.io/Egoinstructor/

关键词

引用

@article{arxiv.2401.00789,
  title  = {Retrieval-Augmented Egocentric Video Captioning},
  author = {Jilan Xu and Yifei Huang and Junlin Hou and Guo Chen and Yuejie Zhang and Rui Feng and Weidi Xie},
  journal= {arXiv preprint arXiv:2401.00789},
  year   = {2024}
}

备注

CVPR 2024. Project page is available at: https://jazzcharles.github.io/Egoinstructor/