中文

MSAC:用于可靠语音情感识别的多重语音属性控制方法

声音 2024-03-25 v3 人工智能 多媒体 音频与语音处理

摘要

尽管取得了显著进展,语音情感识别 (SER) 由于语音情感复杂且模糊的本质,尤其在真实场景中,仍然具有挑战性。当前研究主要关注识别与泛化能力,而我们的研究率先探讨了 SER 方法在语义数据偏移下的可靠性,并探索如何对语音信号中固有的多种属性进行细粒度控制以增强语音情感建模。本文中,我们首先提出 MSAC-SERNet,一种能够同时处理单语料库与跨语料库 SER 的新型统一 SER 框架。具体而言,仅聚焦于语音情感属性,提出一种基于 CNN 的新型 SER 模型,在加性间隔 softmax 损失引导下提取有判别力的情感表示。考虑到不同语音属性间的信息重叠,我们提出一种基于不同语音属性相关性的新型学习范式,称为多重语音属性控制 (MSAC),其使所提 SER 模型在捕获细粒度情感相关特征的同时,减轻与情感无关表示的负面影响。此外,我们首次尝试使用分布外检测方法考察 MSAC-SERNet 框架的可靠性。在单语料库与跨语料库 SER 场景上的实验表明,MSAC-SERNet 不仅在各方面持续优于基线,且相比最先进的 SER 方法取得了更优性能。

关键词

引用

@article{arxiv.2308.04025,
  title  = {MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition},
  author = {Yu Pan and Yuguang Yang and Yuheng Huang and Jixun Yao and Jingjing Yin and Yanni Hu and Heng Lu and Lei Ma and Jianjun Zhao},
  journal= {arXiv preprint arXiv:2308.04025},
  year   = {2024}
}

备注

12 pages