利用问题学习在视频语料库中定位视觉答案
计算机视觉与模式识别
2023-09-27 v4 计算与语言
摘要
我们引入了一项新任务,名为视频语料库视觉答案定位 (VCVAL),旨在利用自然语言问题在大型未剪辑教学视频集合中定位视觉答案。该任务需要一系列技能——视觉与语言之间的交互、视频检索、段落理解以及视觉答案定位。在本文中,我们提出了一种用于 VCVAL 的跨模态对比全局跨度 (CCGS) 方法,利用全局跨度矩阵联合训练视频语料库检索和视觉答案定位子任务。我们重构了一个名为 MedVidCQA 的数据集,并在其上对 VCVAL 任务进行了基准测试。实验结果表明,所提出的方法在视频语料库检索和视觉答案定位子任务中均优于其他有竞争力的方法。最重要的是,我们对大量实验进行了详细分析,为理解教学视频开辟了新路径,并引领了进一步的研究。
引用
@article{arxiv.2210.05423,
title = {Learning to Locate Visual Answer in Video Corpus Using Question},
author = {Bin Li and Yixuan Weng and Bin Sun and Shutao Li},
journal= {arXiv preprint arXiv:2210.05423},
year = {2023}
}
备注
Accepted by ICASSP 2023