将视频元数据挂载于基于 Transformer 的语言模型以实现开放式视频问答
计算机视觉与模式识别
2021-08-12 v1 人工智能
摘要
视频问答近来受到多模态视频研究者的广泛关注。大多数视频问答数据集通常采取多项选择题形式。但多项选择题任务的模型并不推断答案,而是通过比较答案候选来挑选正确答案。此外,这也使其难以扩展到其他任务。在本文中,我们通过将现有多项选择题视频问答改为开放式视频问答来挑战该范式。为应对开放式问答,我们使用预训练的 GPT2 模型。该模型以视频输入与字幕进行微调。通过将现有 DramaQA 数据集改为开放式问答进行消融研究,表明利用视频元数据可提升性能。
引用
@article{arxiv.2108.05158,
title = {Mounting Video Metadata on Transformer-based Language Model for Open-ended Video Question Answering},
author = {Donggeon Lee and Seongho Choi and Youwon Jang and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:2108.05158},
year = {2021}
}
备注
5 pages, 1 figure