中文

TVQA 数据集中的模态偏差研究

计算机视觉与模式识别 2020-12-21 v1 人工智能 计算与语言

摘要

TVQA 是一个基于流行电视节目的大规模视频问答(video-QA)数据集。其问题被专门设计为依据“视觉与语言理解二者方能作答”。本文中,我们展示了该数据集对文本字幕模态的固有偏差。我们直接或间接推断出该偏差,特别发现以字幕训练的模型平均学会抑制视频特征贡献。我们的结果表明,仅以视觉信息训练的模型可回答约 45% 的问题,而仅用字幕可达约 68%。我们发现基于双线性池化的模态联合表示使模型性能下降 9%,意味着对模态特定信息的依赖。我们还表明 TVQA 未能从 VQA 中流行的 RUBi 模态偏差消减技术获益。通过利用 BERT 嵌入改进文本处理,并采用最初为 TVQA 提出的简单模型,我们取得了最先进结果(72.13%),优于高度复杂的 STAGE 模型(70.50%)。我们推荐一种多模态评估框架,可凸显模型中的偏差并隔离依赖视觉与依赖文本的数据子集。利用该框架,我们提出了仅响应单一模态或同时响应双模态的 TVQA 子集,以促进如 TVQA 初衷所愿的多模态建模。

关键词

引用

@article{arxiv.2012.10210,
  title  = {On Modality Bias in the TVQA Dataset},
  author = {Thomas Winterbottom and Sarah Xiao and Alistair McLean and Noura Al Moubayed},
  journal= {arXiv preprint arXiv:2012.10210},
  year   = {2020}
}

备注

10 pages, 4 Figures, 2 Tables, +Supp Mats, BMVC 2020