中文

用于视频问答时间定位的稠密字幕匹配与帧选择门控

计算与语言 2020-05-14 v1 计算机视觉与模式识别 机器学习

摘要

视频传达丰富的信息。视频片段中存在人物/物体之间动态的时空关系以及多样的多模态事件。因此,开发能够准确从视频中提取此类信息的自动化模型十分重要。回答关于视频的问题是可以评估此类人工智能能力的任务之一。本文提出一种视频问答模型,其有效整合多模态输入源并找到时间上相关的信息以回答问题。具体而言,我们首先采用稠密图像字幕来帮助识别物体及其详细的显著区域与动作,从而给模型提供有用的额外信息(以显式文本格式便于匹配)用于回答问题。此外,我们的模型还包含双级注意力(词/物体级与帧级)、针对不同源(视频与稠密字幕)的多头自/交叉整合,以及将更相关信息传递给分类器的门控。最后,我们还将帧选择问题视为多标签分类任务,并引入两种损失函数——帧内外部得分间隔(IOFSM)与平衡二元交叉熵(BBCE)——以利用人工重要性标注更好地监督模型。我们在具有挑战性的 TVQA 数据集上评估我们的模型,其中每个模型组件都带来显著增益,且我们的整体模型大幅优于当前最优方法(74.09% 对比 70.52%)。我们还展示了若干词、物体与帧级可视化研究。我们的代码公开于:https://github.com/hyounghk/VideoQADenseCapFrameGate-ACL2020

关键词

引用

@article{arxiv.2005.06409,
  title  = {Dense-Caption Matching and Frame-Selection Gating for Temporal Localization in VideoQA},
  author = {Hyounghun Kim and Zineng Tang and Mohit Bansal},
  journal= {arXiv preprint arXiv:2005.06409},
  year   = {2020}
}

备注

ACL 2020 (11 pages)