中文

基于互信息正则化的语音情感识别方法

声音 2026-02-13 v4 机器学习

摘要

缺乏大规模、标注完整的情感语音语料库继续限制语音情感识别 (SER) 的性能和鲁棒性,尤其当模型变得更复杂且多模态系统需求增加时。虽然生成式数据增强提供了可行方案,但现有方法常因对类别标签的条件化过于简化,导致生成样本情感不一致。本文引入一种新型互信息正则化生成框架,结合跨模态对齐与特征级合成。基于 InfoGAN 风格的架构,该方法首先学习语义对齐的音频-文本表示空间,利用预训练变换器和对比目标。随后,特征生成器被训练以产生情感感知的音频特征,并利用互信息作为量化正则器,确保生成特征与其条件变量之间存在强依赖。我们将该方法扩展至多模态设置,实现情感感知音频-文本特征的生成。基于三个基准数据集 (IEMOCAP、MSP-IMPROV、MSP-Podcast) 的全面评估表明,我们的框架在现有增强方法中持续领先,实现了最高可达 2.6% 的单模态 SER 和 3.2% 的多模态情感识别性能提升。更重要的是,我们证明互信息既是正则器也是生成质量的可度量指标,为情感计算领域的数据增强提供了系统方法。

关键词

引用

@article{arxiv.2510.10078,
  title  = {Improving Speech Emotion Recognition with Mutual Information Regularized Generative Model},
  author = {Chung-Soo Ahn and Rajib Rana and Sunil Sivadas and Carlos Busso and Jagath C. Rajapakse},
  journal= {arXiv preprint arXiv:2510.10078},
  year   = {2026}
}