通过自监督学习特征的分段平均池化提升语音情感识别
声音
2024-10-17 v1 人工智能
音频与语音处理
摘要
语音情感识别 (SER) 分析人类通过语音表达的情感。自监督学习 (SSL) 为 SER 提供了有前景的approach,通过从大量无标签音频数据中学习有意义的表示。然而,现有的 SSL-based 方法依赖于全局平均池化 (GAP) 来表示音频信号,将语音和非语音段 treated equally。这可能导致对信息丰富的语音特征被无关的非语音信息稀释。为此,本文提出了分段平均池化 (SAP),其选择性地关注信息丰富的语音段 while忽略非语音段。通过对 SSL 特征同时应用 GAP 和 SAP,我们的方法利用 GAP 获取整体语音信号信息,同时从 SAP 获取特定信息,从而提高 SER 性能。实验表明,在 IEMOCAP 英文数据集和KEMDy19 韩语数据集上,我们的方法在 unweighted 和 weighted 准确率方面均实现了最新进展。
引用
@article{arxiv.2410.12416,
title = {Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features},
author = {Jonghwan Hyeon and Yung-Hwan Oh and Ho-Jin Choi},
journal= {arXiv preprint arXiv:2410.12416},
year = {2024}
}