中文

压迫环境下的多麦克风和多模态情感识别

声音 2025-07-30 v3 机器学习 音频与语音处理

摘要

本文提出了一种多模态情感识别(MER)系统,旨在增强在挑战性声学条件下的情感识别准确性。我们的方法将修改和扩展的分层词语语义音频转换器(HTS-AT)用于多通道音频处理,同时采用R(2+1)D卷积神经网络(CNN)模型进行视频分析。我们在压迫版本的里森大学音频-视觉情感语音和歌曲数据库(RAVDESS)数据集上进行评估,该数据集使用合成和真实世界的房间脉冲响应(RIRs)。我们的结果表明,整合音频和视频模态的方法在准确性上优于单模态方法,尤其是在挑战性声学条件下。此外,我们还表明,利用多个麦克风的多模态(音视频)方法优于其单麦克风等价方法。

关键词

引用

@article{arxiv.2409.09545,
  title  = {Multi-Microphone and Multi-Modal Emotion Recognition in Reverberant Environment},
  author = {Ohad Cohen and Gershon Hazan and Sharon Gannot},
  journal= {arXiv preprint arXiv:2409.09545},
  year   = {2025}
}

备注

5 pages, 4 figures, 2 tables. Accepted to EUSIPCO 2025