中文

对于多模态情感识别,交叉注意力是否优于自注意力?

机器学习 2022-02-21 v1 多媒体

摘要

人类通过面部表情、声音语调和用词选择来表达情感。为了推断潜在情感的本质,识别模型可以使用单一模态(如视觉、音频和文本)或多种模态的组合。通常,融合来自多种模态互补信息的模型优于其单模态对应模型。然而,成功的模态融合模型需要能够有效地从每种模态中聚合与任务相关信息的组件。由于跨模态注意力被视为多模态融合的有效机制,本文量化了该机制相较于相应的自注意力机制所带来的增益。为此,我们实现并比较了交叉注意力模型和自注意力模型。除注意力外,每个模型还使用卷积层进行局部特征提取,并使用循环层进行全局序列建模。我们使用 IEMOCAP 数据集,针对 7 类情感分类任务,比较了不同模态组合下模型的表现。实验结果表明,尽管两个模型在三模态和双模态配置下的加权和未加权准确率均优于现有技术,但它们的性能在总体上具有统计学可比性。复现实验的代码可在 https://github.com/smartcameras/SelfCrossAttn 获取。

关键词

引用

@article{arxiv.2202.09263,
  title  = {Is Cross-Attention Preferable to Self-Attention for Multi-Modal Emotion Recognition?},
  author = {Vandana Rajan and Alessio Brutti and Andrea Cavallaro},
  journal= {arXiv preprint arXiv:2202.09263},
  year   = {2022}
}

备注

Accepted at ICASSP 2022