中文

通过自监督学习特征的分段平均池化提升语音情感识别

声音 2024-10-17 v1 人工智能 音频与语音处理

摘要

语音情感识别 (SER) 分析人类通过语音表达的情感。自监督学习 (SSL) 为 SER 提供了有前景的approach,通过从大量无标签音频数据中学习有意义的表示。然而,现有的 SSL-based 方法依赖于全局平均池化 (GAP) 来表示音频信号,将语音和非语音段 treated equally。这可能导致对信息丰富的语音特征被无关的非语音信息稀释。为此,本文提出了分段平均池化 (SAP),其选择性地关注信息丰富的语音段 while忽略非语音段。通过对 SSL 特征同时应用 GAP 和 SAP,我们的方法利用 GAP 获取整体语音信号信息,同时从 SAP 获取特定信息,从而提高 SER 性能。实验表明,在 IEMOCAP 英文数据集和KEMDy19 韩语数据集上,我们的方法在 unweighted 和 weighted 准确率方面均实现了最新进展。

关键词

引用

@article{arxiv.2410.12416,
  title  = {Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features},
  author = {Jonghwan Hyeon and Yung-Hwan Oh and Ho-Jin Choi},
  journal= {arXiv preprint arXiv:2410.12416},
  year   = {2024}
}