中文

SZTU-CMU at MER2024:通过 Conv-Attention 改进 Emotion-LLaMA 以实现多模态情感识别

多媒体 2024-08-23 v2 计算机视觉与模式识别 声音 音频与语音处理

摘要

本文提出了我们在多模态情感识别 MER2024 挑战赛 MER-NOISE 和 MER-OV 赛道中的获胜方案。我们的系统利用 Emotion-LLaMA 先进的情感理解能力,为无标签样本生成高质量标注,以应对标注数据有限的挑战。为增强多模态融合同时缓解模态特定噪声,我们提出了 Conv-Attention,一种轻量高效混合框架。大量实验验证了我们方法的有效性。在 MER-NOISE 赛道中,我们的系统取得了 85.30% 的先进加权平均 F 分数,分别领先第二名和第三名队伍 1.47% 和 1.65%。在 MER-OV 赛道中,我们利用 Emotion-LLaMA 进行开放词汇标注,相比 GPT-4V 在平均准确率和召回率上提升了 8.52%,在所有参与的大型多模态模型中取得了最高分。Emotion-LLaMA 的代码和模型可在 https://github.com/ZebangCheng/Emotion-LLaMA 获取。

关键词

引用

@article{arxiv.2408.10500,
  title  = {SZTU-CMU at MER2024: Improving Emotion-LLaMA with Conv-Attention for Multimodal Emotion Recognition},
  author = {Zebang Cheng and Shuyuan Tu and Dawei Huang and Minghan Li and Xiaojiang Peng and Zhi-Qi Cheng and Alexander G. Hauptmann},
  journal= {arXiv preprint arXiv:2408.10500},
  year   = {2024}
}

备注

Ranked 1st in MER24@IJCAI and MRAC24@ACM MM (MER-NOISE & MER-OV (self-evaluated))