用于多选视频问答的自监督预训练与对比表示学习
计算与语言
2020-12-15 v2
摘要
视频问答需要细粒度地理解视频和语言两种模态以回答给定问题。本文提出了一种用于多选视频问答的新型训练方案,包含一个自监督预训练阶段,以及将监督对比学习作为主阶段的辅助学习。在自监督预训练阶段,我们将预测正确答案的原始问题格式转换为预测相关问题,从而在不增加任何额外数据集或标注的情况下为模型提供更广泛的上下文输入。在主阶段的对比学习中,我们对对应于真实答案的输入添加掩蔽噪声,并将真实答案的原始输入作为正样本,其余作为负样本。通过将正样本映射得更靠近被掩蔽的输入,我们表明模型性能得到了提升。我们进一步采用局部对齐注意力,以更有效地聚焦于与给定对应字幕句子特别相关的视频帧。我们在与多选视频问答相关的高度竞争的基准数据集 TVQA、TVQA+ 和 DramaQA 上评估了所提出的模型。实验结果表明,我们的模型在所有数据集上均取得了 state-of-the-art 的性能。我们还通过进一步分析验证了我们的方法。
引用
@article{arxiv.2009.08043,
title = {Self-supervised pre-training and contrastive representation learning for multiple-choice video QA},
author = {Seonhoon Kim and Seohyeong Jeong and Eunbyul Kim and Inho Kang and Nojun Kwak},
journal= {arXiv preprint arXiv:2009.08043},
year = {2020}
}
备注
Accepted at AAAI 2021