中文

EgoVLPv2:基于骨干网络融合的自我中心视频-语言预训练

计算机视觉与模式识别 2023-08-22 v2

摘要

视频-语言预训练(VLP)因其泛化到各种视觉与语言任务的能力而变得日益重要。然而,现有的自我中心 VLP 框架利用独立的视频和语言编码器,并仅在微调期间学习任务特定的跨模态信息,限制了统一系统的发展。在本工作中,我们介绍了第二代自我中心视频-语言预训练(EgoVLPv2),相较于前一代有显著改进,通过将跨模态融合直接整合进视频和语言骨干网络。EgoVLPv2 在预训练期间学习强视频-文本表示,并重用跨模态注意力模块以灵活高效的方式支持不同下游任务,降低微调成本。此外,我们提出的骨干网络内融合策略比堆叠额外的融合专用层更轻量且计算高效。在广泛 VL 任务上的大量实验证明了 EgoVLPv2 的有效性,在所有下游任务上相较强基线取得一致的最先进性能。我们的项目页面位于 https://shramanpramanick.github.io/EgoVLPv2/。

关键词

引用

@article{arxiv.2307.05463,
  title  = {EgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the Backbone},
  author = {Shraman Pramanick and Yale Song and Sayan Nag and Kevin Qinghong Lin and Hardik Shah and Mike Zheng Shou and Rama Chellappa and Pengchuan Zhang},
  journal= {arXiv preprint arXiv:2307.05463},
  year   = {2023}
}

备注

Published in ICCV 2023