交叉注意力尚不足够:面向多模态情感识别的不一致感知动态分层融合
计算与语言
2023-11-14 v4 多媒体
音频与语音处理
图像与视频处理
摘要
融合多种模态已被证明对多模态信息处理有效。然而,模态间的不一致性给多模态融合带来了挑战,尤其在情感识别中。在本研究中,我们首先分析一个模态中的显著情感信息如何受另一模态影响,并证明跨模态注意力中潜在地存在模态间不一致性。基于该发现,我们提出具有动态模态门控的分层跨模态Transformer(HCT-DMG),一种轻量的不一致感知模型,它在每个训练批次中动态选择主模态,并利用潜空间中学习到的层次结构减少融合次数以缓解不一致性。在五个基准数据集上的实验评估:CMU-MOSI、CMU-MOSEI 和 IEMOCAP(情感与情绪,其中不一致性隐式存在于困难样本中),以及 UR-FUNNY(幽默)和 MUStaRD(讽刺,其中不一致性普遍存在),验证了我们的方法的有效性,表明 HCT-DMG:1) 以约 0.8M 参数的精简规模优于以往多模态模型;2) 能识别因不一致性导致情感识别困难的困难样本;3) 在跨模态注意力的潜层层面缓解不一致性。
引用
@article{arxiv.2305.13583,
title = {Cross-Attention is Not Enough: Incongruity-Aware Dynamic Hierarchical Fusion for Multimodal Affect Recognition},
author = {Yaoting Wang and Yuanchao Li and Paul Pu Liang and Louis-Philippe Morency and Peter Bell and Catherine Lai},
journal= {arXiv preprint arXiv:2305.13583},
year = {2023}
}
备注
*First two authors contributed equally