观察与学习:利用自监督将语言与含噪真实世界视频进行映射
计算机视觉与模式识别
2021-01-12 v2
摘要
本文中,我们通过在无显式标注的情况下学习句子与含噪视频片段之间的映射,教会机器理解视觉与自然语言。首先,我们定义了一个捕获跨模态信息的自监督学习框架。随后引入一种新颖的对抗学习模块,以显式处理自然视频中的噪声,其中字幕句子并不保证与视频片段强对应。为训练与评估,我们贡献了一个新数据集‘ApartmenTour’,其包含大量在线视频与字幕。我们在句子与视频的双向检索任务上开展实验,结果表明我们所提模型在两个检索任务上均取得了最先进(SOTA)性能,并超越若干强基线。该数据集可在 https://github.com/zyj-13/WAL 下载。
引用
@article{arxiv.2011.09634,
title = {Watch and Learn: Mapping Language and Noisy Real-world Videos with Self-supervision},
author = {Yujie Zhong and Linhai Xie and Sen Wang and Lucia Specia and Yishu Miao},
journal= {arXiv preprint arXiv:2011.09634},
year = {2021}
}
备注
NeurIPS 2020 Self-Supervised Learning Workshop