使用对比双向 Transformer 学习视频表示
机器学习
2019-10-01 v2 计算机视觉与模式识别
机器学习
摘要
本文提出了一种用于视频特征的自监督学习方法,与现有方法相比,该方法在下游任务(如视频分类、字幕生成和分割)上的性能有显著提升。我们的方法通过将 softmax 损失替换为噪声对比估计(NCE),将用于文本序列的 BERT 模型扩展到实值特征向量序列的情况。我们还展示了如何从视觉特征序列和源自 ASR(自动语音识别)的词序列中学习表示,并表明这种跨模态训练(在可行时)能带来更大的提升。
引用
@article{arxiv.1906.05743,
title = {Learning Video Representations using Contrastive Bidirectional Transformer},
author = {Chen Sun and Fabien Baradel and Kevin Murphy and Cordelia Schmid},
journal= {arXiv preprint arXiv:1906.05743},
year = {2019}
}