绘制深度学习在语音情感识别领域的 15 年进展:复制研究
声音
2025-08-05 v1 音频与语音处理
摘要
语音情感识别(SER)长期受益于深度学习方法的采纳。拥有更多层数和更多可训练参数的深度模型通常被 SER 社区认为是“更好”的。由此引出的问题是——\emph{它们到底好在哪里}?更重要的问题是如何前进仍然迫切。在本工作中,我们尝试量化自 2009 年国际语音情感挑战赛(INTERSPEECH Emotion Challenge)首次引入以来 15 年的研究进展。我们对模型架构进行大规模调查,涵盖依赖语音输入的音频模型和仅依赖转录文本的文本模型。我们的结果指向收益递减和在最近引入 transformer 架构后出现的平台期。此外,我们演示了进度感受如何取决于所比较模型的选择。我们的发现对 SER 研究的当前最前沿状态以及未来之路具有重要启示。
关键词
引用
@article{arxiv.2508.02448,
title = {Charting 15 years of progress in deep learning for speech emotion recognition: A replication study},
author = {Andreas Triantafyllopoulos and Anton Batliner and Björn W. Schuller},
journal= {arXiv preprint arXiv:2508.02448},
year = {2025}
}
备注
Code: https://github.com/CHI-TUM/ser-progress-replication Submitted for review