中文

用于视频-文本表示学习的支持集瓶颈

计算机视觉与模式识别 2021-01-15 v2

摘要

学习视频-文本表示的主导范式——噪声对比学习——提高了已知相关样本对(例如来自同一样本的文本和视频)表示的相似性,并将所有其他样本对的表示推远。我们认为这最后一种行为过于严格,即使对于语义相关的样本(例如视觉上相似的视频或具有相同描绘动作的视频)也强制不相似的表示。在本文中,我们提出一种新方法,通过利用生成模型自然地将相关样本推近以缓解此问题:每个样本的标题必须作为其他支持样本视觉表示的加权组合来重建。这一简单思想确保表示不会过度专门化于单个样本,可在整个数据集中复用,并产生显式编码样本间共享语义的表示,这与噪声对比学习不同。我们提出的方法在MSR-VTT、VATEX、ActivityNet和MSVD的视频到文本及文本到视频检索上大幅优于其他方法。

关键词

引用

@article{arxiv.2010.02824,
  title  = {Support-set bottlenecks for video-text representation learning},
  author = {Mandela Patrick and Po-Yao Huang and Yuki Asano and Florian Metze and Alexander Hauptmann and João Henriques and Andrea Vedaldi},
  journal= {arXiv preprint arXiv:2010.02824},
  year   = {2021}
}

备注

Accepted as spotlight paper at the International Conference on Learning Representations (ICLR) 2021