VideoBERT:一种用于视频与语言表示联合学习的模型
计算机视觉与模式识别
2019-09-13 v2 人工智能
摘要
自监督学习在利用 YouTube 等平台上大量无标签数据方面已变得愈发重要。尽管大多数现有方法学习低层表示,我们提出一种联合视觉-语言模型,以在无任何显式监督的情况下学习高层特征。特别地,受近期在语言建模中成功的启发,我们基于 BERT 模型构建,以学习视觉与语言 token 序列上的双向联合分布,这些 token 分别源自视频数据的向量量化与现成语音识别输出。我们将 VideoBERT 应用于众多任务,包括动作分类与视频字幕生成。我们表明它可直接用于开放词表分类,并确认大量训练数据与跨模态信息对性能至关重要。此外,我们在视频字幕生成上优于当前最优(SOTA)方法,且定量结果验证了该模型学习到了高层语义特征。
引用
@article{arxiv.1904.01766,
title = {VideoBERT: A Joint Model for Video and Language Representation Learning},
author = {Chen Sun and Austin Myers and Carl Vondrick and Kevin Murphy and Cordelia Schmid},
journal= {arXiv preprint arXiv:1904.01766},
year = {2019}
}
备注
ICCV 2019 camera ready