中文

用于多模态融合的注意力瓶颈

计算机视觉与模式识别 2022-12-02 v3

摘要

人类通过并发处理并融合来自视觉、音频等多种模态的高维输入来感知世界。与之形成鲜明对比的是,机器感知模型通常是特定于模态的,并针对单模态基准进行优化,因此来自各模态最终表示或预测的晚期融合(‘late-fusion’)仍是多模态视频分类的主流范式。为此,我们引入了一种基于 Transformer 的新颖架构,该架构在多个层级使用‘融合瓶颈’进行模态融合。相较于传统的成对自注意力,我们的模型强制不同模态之间的信息通过少量瓶颈隐变量传递,要求模型整理并浓缩各模态中最相关的信息,仅共享必要部分。我们发现该策略在提升融合性能的同时降低了计算成本。我们进行了充分的消融实验,并在 Audioset、Epic-Kitchens 和 VGGSound 等多个音视频分类基准上取得了最先进(state-of-the-art, SOTA)结果。所有代码与模型将公开发布。

关键词

引用

@article{arxiv.2107.00135,
  title  = {Attention Bottlenecks for Multimodal Fusion},
  author = {Arsha Nagrani and Shan Yang and Anurag Arnab and Aren Jansen and Cordelia Schmid and Chen Sun},
  journal= {arXiv preprint arXiv:2107.00135},
  year   = {2022}
}

备注

Published at NeurIPS 2021. Note this version updates numbers due to a bug in the AudioSet mAP calculation in Table 1 (last row)