刺激模态至关重要:来自不同模态的感知评估对语音情感识别系统性能的影响
音频与语音处理
2025-10-15 v4 多媒体
声音
信号处理
摘要
语音情感识别(SER)系统依赖于语音输入和由人类标注的情感标签。然而,各种情感数据库收集感知评估的方式各不相同。例如,IEMOCAP 数据集使用带声音的视频片段供标注者提供其情感感知。然而,最重要的英语情感数据集 MSP-PODCAST 仅提供语音供评分者选择情感评级。尽管如此,使用语音作为输入是训练 SER 系统的标准方法。因此,一个悬而未决的问题是,由哪种场景诱发的情感标签对训练 SER 系统最有效。我们全面比较了使用不同模态刺激诱发的标签训练的 SER 系统的有效性,并在各种测试条件下评估了这些 SER 系统。此外,我们引入了一种结合由各种模态诱发的所有标签的包容性标签。我们表明,使用仅由语音刺激诱发的标签进行训练在测试集上产生了更好的性能,而标签由仅语音刺激诱发。
引用
@article{arxiv.2409.10762,
title = {Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance},
author = {Huang-Cheng Chou and Haibin Wu and Hung-yi Lee and Chi-Chun Lee},
journal= {arXiv preprint arXiv:2409.10762},
year = {2025}
}
备注
5 pages, 2 figures, 4 tables, acceptance for ICASSP 2025