中文

情感信息的早期联合学习使多模态模型更好地理解你

多媒体 2024-10-01 v1 人工智能 声音 音频与语音处理

摘要

在本文中,我们提出了用于多模态情感识别挑战赛(MER2024)各子挑战中情感识别的解决方案。为缓解音频与文本之间的模态竞争问题,我们采用基于大型语言模型的早期融合策略,首先对音频与文本进行联合训练。随后,联合的音频-文本模态特征将与其他单模态特征进行后期融合。为解决数据不足和类别不平衡问题,我们使用多轮多模型投票进行数据挖掘。此外,为提升音频特征质量,我们采用语音源分离对音频进行预处理。我们的模型在 MER2024-SEMI 和 MER2024-NOISE 中均排名第 2,验证了我们方法的有效性。

关键词

引用

@article{arxiv.2409.18971,
  title  = {Early Joint Learning of Emotion Information Makes MultiModal Model Understand You Better},
  author = {Mengying Ge and Mingyang Li and Dongkai Tang and Pengbo Li and Kuo Liu and Shuhao Deng and Songbai Pu and Long Liu and Yang Song and Tao Zhang},
  journal= {arXiv preprint arXiv:2409.18971},
  year   = {2024}
}