中文

基于四元数乘积的多层内容交互用于视觉问答

计算机视觉与模式识别 2020-02-18 v2 图像与视频处理

摘要

近年来,多模态融合技术大幅提升了基于神经网络的视频描述/字幕、视觉问答(VQA)和音视觉场景感知对话(AVSD)的性能。以往多数方法仅探索多层特征融合的最后一层,而忽略了中间层的重要性。为解决中间层的问题,我们提出一种高效的四元数块网络(QBN),以同时学习最后一层及所有中间层的交互。在所提出的 QBN 中,我们利用整体文本特征来引导视觉特征的更新。同时,哈密顿四元数乘积能够高效地将信息从高层流向低层,涵盖视觉与文本两种模态。评估结果表明,即便使用超大规模 BERT 或视觉 BERT 预训练模型,我们的 QBN 仍提升了在 VQA 2.0 上的性能。我们进行了充分的消融实验以验证本研究各提出模块的影响。

关键词

引用

@article{arxiv.2001.05840,
  title  = {Multi-Layer Content Interaction Through Quaternion Product For Visual Question Answering},
  author = {Lei Shi and Shijie Geng and Kai Shuang and Chiori Hori and Songxiang Liu and Peng Gao and Sen Su},
  journal= {arXiv preprint arXiv:2001.05840},
  year   = {2020}
}