中文

面向多模态视频问答的帧-字幕自监督

计算机视觉与模式识别 2022-09-09 v1 多媒体

摘要

多模态视频问答旨在预测正确答案并定位与问题相关的时间边界。问题的时序标注提升了近期工作的问答性能与可解释性,但它们通常依赖经验且代价高昂。为避免时序标注,我们设计了一种弱监督问题定位(WSQG)设定,其中仅使用问答标注,并根据时间注意力分数生成相关时间边界。为替代时序标注,我们将帧与字幕之间的对应关系转化为帧-字幕(FS)自监督,其有助于优化时间注意力分数,从而提升 VideoQA 模型中的视频-语言理解。在 TVQA 和 TVQA+ 数据集上的大量实验表明,所提出的 WSQG 策略在问题定位上取得了可比性能,且 FS 自监督在仅问答监督与全监督两种设定下均有助于提升问答与定位性能。

关键词

引用

@article{arxiv.2209.03609,
  title  = {Frame-Subtitle Self-Supervision for Multi-Modal Video Question Answering},
  author = {Jiong Wang and Zhou Zhao and Weike Jin},
  journal= {arXiv preprint arXiv:2209.03609},
  year   = {2022}
}