压迫环境下的多麦克风和多模态情感识别
声音
2025-07-30 v3 机器学习
音频与语音处理
摘要
本文提出了一种多模态情感识别(MER)系统,旨在增强在挑战性声学条件下的情感识别准确性。我们的方法将修改和扩展的分层词语语义音频转换器(HTS-AT)用于多通道音频处理,同时采用R(2+1)D卷积神经网络(CNN)模型进行视频分析。我们在压迫版本的里森大学音频-视觉情感语音和歌曲数据库(RAVDESS)数据集上进行评估,该数据集使用合成和真实世界的房间脉冲响应(RIRs)。我们的结果表明,整合音频和视频模态的方法在准确性上优于单模态方法,尤其是在挑战性声学条件下。此外,我们还表明,利用多个麦克风的多模态(音视频)方法优于其单麦克风等价方法。
关键词
引用
@article{arxiv.2409.09545,
title = {Multi-Microphone and Multi-Modal Emotion Recognition in Reverberant Environment},
author = {Ohad Cohen and Gershon Hazan and Sharon Gannot},
journal= {arXiv preprint arXiv:2409.09545},
year = {2025}
}
备注
5 pages, 4 figures, 2 tables. Accepted to EUSIPCO 2025