中文

使用对比双向 Transformer 学习视频表示

机器学习 2019-10-01 v2 计算机视觉与模式识别 机器学习

摘要

本文提出了一种用于视频特征的自监督学习方法,与现有方法相比,该方法在下游任务(如视频分类、字幕生成和分割)上的性能有显著提升。我们的方法通过将 softmax 损失替换为噪声对比估计(NCE),将用于文本序列的 BERT 模型扩展到实值特征向量序列的情况。我们还展示了如何从视觉特征序列和源自 ASR(自动语音识别)的词序列中学习表示,并表明这种跨模态训练(在可行时)能带来更大的提升。

关键词

引用

@article{arxiv.1906.05743,
  title  = {Learning Video Representations using Contrastive Bidirectional Transformer},
  author = {Chen Sun and Fabien Baradel and Kevin Murphy and Cordelia Schmid},
  journal= {arXiv preprint arXiv:1906.05743},
  year   = {2019}
}