MSAF:多模态分割注意力融合
计算机视觉与模式识别
2021-06-29 v2 机器学习
摘要
多模态学习模拟人类多感官系统的推理过程,用于感知周围世界。在进行预测时,人脑倾向于关联来自多个信息源的关键线索。在这项工作中,我们提出了一种新颖的多模态融合模块,该模块学习在所有模态中强调贡献更大的特征。具体而言,所提出的多模态分割注意力融合(MSAF)模块将每个模态按通道分割为相等的特征块,并创建一个联合表示,用于为各特征块中的每个通道生成软注意力。此外,MSAF模块被设计为兼容不同空间维度和序列长度的特征,适用于CNN和RNN。因此,MSAF可以轻松添加到任何单模态网络中以融合特征,并利用现有的预训练单模态模型权重。为证明我们融合模块的有效性,我们设计了三个带有MSAF的多模态网络,分别用于情感识别、情感分析和动作识别任务。我们的方法在每个任务上都取得了具有竞争力的结果,并优于其他特定应用网络和多媒体融合基准。
引用
@article{arxiv.2012.07175,
title = {MSAF: Multimodal Split Attention Fusion},
author = {Lang Su and Chuqing Hu and Guofa Li and Dongpu Cao},
journal= {arXiv preprint arXiv:2012.07175},
year = {2021}
}