ECMF:用于 MER-SEMI 挑战中多模态情感识别的增强跨模态融合
计算机视觉与模式识别
2025-08-11 v1 人工智能
计算机与社会
摘要
情感识别在提升人机交互方面发挥着关键作用。本研究通过提出一种新型的多模态情感识别框架,解决 MER2025 竞赛中的 MER-SEMI 挑战。为解决数据稀缺问题,我们利用大规模预训练模型从视觉、音频和文本三种模态中提取信息丰富的特征。具体而言,对于视觉模态,我们设计了双分支视觉编码器,以捕获全局帧级特征和局部面部表征。对于文本模态,我们引入上下文丰富方法,运用大语言模型丰富输入文本中的情感线索。为有效整合这些多模态特征,我们提出了两种关键组件的融合策略,即用于动态模态加权的自注意力机制,以及用于保留原始表征的残差连接。除架构设计外,我们还通过多来源标注策略细化训练集中的噪声标签。我们的方法在 MER2025-SEMI 数据集上实现了显著的性能提升,加权 F1 分数从 78.63% 提升至 87.49%,验证了所提出框架的有效性。
引用
@article{arxiv.2508.05991,
title = {ECMF: Enhanced Cross-Modal Fusion for Multimodal Emotion Recognition in MER-SEMI Challenge},
author = {Juewen Hu and Yexin Li and Jiulin Li and Shuo Chen and Pring Wong},
journal= {arXiv preprint arXiv:2508.05991},
year = {2025}
}