中文

基于可学习区域的视频-文本预训练

计算机视觉与模式识别 2021-12-07 v2 多媒体

摘要

视频-文本预训练旨在通过对齐视觉与文本信息之间的语义,从大规模视频-文本对中学习可迁移的表征。最先进的方法以端到端方式从原始像素中提取视觉特征。然而,这些方法直接作用于帧级,因而忽略了视频中物体的时空结构,而该结构与文本描述中的名词具有强烈的协同性。在本工作中,我们提出了一个简单而有效的视频-文本表征学习模块,即 RegionLearner,它能够在大规模视频-文本对预训练过程中考虑物体的结构。给定一段视频,我们的模块(1)首先将视觉特征量化为语义簇,(2)随后生成可学习掩码并用其聚合属于同一语义区域的特征,(3)最后对不同聚合区域之间的交互进行建模。与使用现成目标检测器相比,我们提出的模块不需要显式监督且计算效率更高。我们在公开的 WebVid2M 和 CC3M 数据集上预训练所提方法。在四个下游视频-文本检索基准上的大量评估清楚地证明了我们的 RegionLearner 的有效性。代码将发布于 https://github.com/ruiyan1995/Region_Learner。

关键词

引用

@article{arxiv.2112.01194,
  title  = {Video-Text Pre-training with Learned Regions},
  author = {Rui Yan and Mike Zheng Shou and Yixiao Ge and Alex Jinpeng Wang and Xudong Lin and Guanyu Cai and Jinhui Tang},
  journal= {arXiv preprint arXiv:2112.01194},
  year   = {2021}
}