通过对齐与标签匹配增强模态融合以实现多模态情感识别
多媒体
2024-08-20 v1 人工智能
计算机视觉与模式识别
声音
摘要
为解决多模态情感识别(MER)中模态间信息融合带来的性能局限,我们提出了一种基于多任务学习的新型 MER 框架 Foal-Net,其中融合在对齐之后进行。该框架旨在增强模态融合的有效性,包含两个辅助任务:音频-视频情感对齐(AVEL)和跨模态情感标签匹配(MEM)。首先,AVEL 通过对比学习实现音频-视频表示中情感信息的对齐。然后,模态融合网络整合对齐后的特征。同时,MEM 评估当前样本对的情感是否相同,为模态信息融合提供辅助,并引导模型更关注情感信息。在 IEMOCAP 语料库上进行的实验结果表明,Foal-Net 优于最先进的方法,且情感对齐在模态融合之前是必要的。
引用
@article{arxiv.2408.09438,
title = {Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition},
author = {Qifei Li and Yingming Gao and Yuhua Wen and Cong Wang and Ya Li},
journal= {arXiv preprint arXiv:2408.09438},
year = {2024}
}
备注
The paper has been accepted by INTERSPEECH 2024