中文

面向时序动作定位的低保真端到端视频编码器预训练

计算机视觉与模式识别 2021-11-01 v3

摘要

时序动作定位(TAL)是视频理解中基础且具有挑战性的任务。现有 TAL 方法依赖于通过动作分类监督预训练视频编码器。这导致视频编码器存在任务差异问题——为动作分类而训练,却用于 TAL。直观上,端到端模型优化是一种好的解决方案。然而,由于处理长未修剪视频的计算成本过高,受 GPU 内存限制,这对 TAL 并不可行。本文中,我们通过引入一种新颖的低保真端到端(LoFi)视频编码器预训练方法解决该挑战。我们不再始终使用完整训练配置进行 TAL 学习,而是提出从时间、空间或时空分辨率方面缩减小批量构成,使得视频编码器的端到端优化在中端硬件预算的内存条件下变得可行。关键在于,这使得梯度能够从 TAL 损失监督反向流经视频编码器,有利地解决了任务差异问题并提供更有效的特征表示。大量实验表明,所提出的 LoFi 预训练方法能显著提升现有 TAL 方法的性能。令人鼓舞的是,即便使用基于轻量 ResNet18 的单 RGB 流视频编码器,我们的方法也常以明显优势超越基于双流 ResNet50 且使用昂贵光流的方法。

关键词

引用

@article{arxiv.2103.15233,
  title  = {Low-Fidelity End-to-End Video Encoder Pre-training for Temporal Action Localization},
  author = {Mengmeng Xu and Juan-Manuel Perez-Rua and Xiatian Zhu and Bernard Ghanem and Brais Martinez},
  journal= {arXiv preprint arXiv:2103.15233},
  year   = {2021}
}

备注

To appear at NeurIPS 2021. 15 pages, 1 figure