视频问答中对话的隐藏宝藏
计算机视觉与模式识别
2021-08-20 v2
摘要
从原始数据中对电影和电视剧等视频中的故事进行高层理解极具挑战性。现代视频问答(VideoQA)系统常使用剧情简介、剧本、视频描述或知识库等额外人工来源。本文提出一种无需此类外部来源即可理解完整故事的新方法。秘诀在于对话:与以往任何工作不同,我们将对话视为一种噪声源,通过对话摘要转化为文本描述,正如近期方法处理视频那样。每种模态的输入由 transformer 独立编码,并通过一种简单融合方法结合所有模态,利用软时间注意力在长输入上实现定位。我们的模型在 KnowIT VQA 数据集上大幅优于当前最优方法,且未使用针对问题的标注或人工撰写的剧情摘要。它甚至优于从未观看过任何完整剧集的人工评估者。代码见 https://engindeniz.github.io/dialogsummary-videoqa
引用
@article{arxiv.2103.14517,
title = {On the hidden treasure of dialog in video question answering},
author = {Deniz Engin and François Schnitzler and Ngoc Q. K. Duong and Yannis Avrithis},
journal= {arXiv preprint arXiv:2103.14517},
year = {2021}
}
备注
ICCV 2021