中文

基于跨模态互知识转移的视觉问答定位

计算机视觉与模式识别 2022-10-31 v3 人工智能

摘要

视频中视觉问答定位(VAL)的目标是从视频中获取一段相关且简洁的时间片段,作为对给定自然语言问题的回答。早期方法基于视频与文本之间的交互建模,通过视觉预测器预测视觉答案。后来,使用带字幕的文本预测器进行 VAL 被证明更为精确。然而,这些现有方法在视觉帧或文本字幕方面仍存在跨模态知识偏差。在本文中,我们提出了一种跨模态互知识转移片段定位(MutualSL)方法以减少知识偏差。MutualSL 同时包含视觉预测器和文本预测器,我们期望两者的预测结果保持一致,从而促进跨模态间的语义知识理解。在此基础上,我们设计了一种单向动态损失函数来动态调整知识转移的比例。我们在三个公开数据集上进行了广泛的评估实验。实验结果表明,我们的方法优于其他具有竞争力的 SOTA 方法,证明了其有效性。

关键词

引用

@article{arxiv.2210.14823,
  title  = {Visual Answer Localization with Cross-modal Mutual Knowledge Transfer},
  author = {Yixuan Weng and Bin Li},
  journal= {arXiv preprint arXiv:2210.14823},
  year   = {2022}
}

备注

4 pages, 3 figures, 2 tables