RAMer:基于重构的对抗模型用于多方多模态多标签情感识别
计算机视觉与模式识别
2025-09-03 v2 人工智能
摘要
传统多模态多标签情感识别(MMER)假设可以完全获取视觉、文本和声学模态。然而,真实的多方场景经常违反这一假设,因为非说话者经常缺乏声学和文本输入,导致模型性能显著下降。现有方法还倾向于将异构模态统一为单一表示,忽略了每种模态的独特特征。为应对这些挑战,我们提出RAMer(基于重构的情感识别对抗模型),通过不仅探索模态共性与特性,更关键的是利用经对比学习增强的重构特征来克服数据不完整性并丰富特征质量,从而细化多模态表示。RAMer还引入人格辅助任务,利用模态级注意力补充缺失模态,提升情感推理能力。为进一步增强模型捕捉标签与模态间依赖关系的能力,我们提出堆叠洗牌策略以丰富标签与模态特定特征之间的相关性。在三个基准数据集——MEmoR、CMU-MOSEI和上的实验表明,RAMer在二元和多方的MMER场景中达到了最先进的性能。
引用
@article{arxiv.2502.10435,
title = {RAMer: Reconstruction-based Adversarial Model for Multi-party Multi-modal Multi-label Emotion Recognition},
author = {Xudong Yang and Yizhang Zhu and Hanfeng Liu and Zeyi Wen and Nan Tang and Yuyu Luo},
journal= {arXiv preprint arXiv:2502.10435},
year = {2025}
}
备注
9 pages