利用 OpenAI Whisper 表示和注意力池化方法的语音情感识别
人工智能
2026-02-10 v1 计算与语言
机器学习
声音
摘要
语音情感识别 (SER) 研究面临数据集标准化和规模不足的限制。最近的研究利用预训练模型提取特征以用于下游任务,如 SER。本工作探讨了 Whisper——一个预训练的语音识别系统——在语音情感识别中的能力,通过提出两种注意力池化方法(多头注意力平均池化和 QKV 池化),高效地降低 Whisper 表示的维度,同时保留情感特征。我们在英语和波斯语上进行实验,分别使用 IEMOCAP 和 ShEMO 数据集,以及 Whisper Tiny 和 Small。我们的多头 QKV 架构在 ShEMO 数据集上实现了状态最佳结果,无加权准确率提升 2.47%。我们进一步比较了不同 Whisper 编码器层的性能,发现中间层在波斯语数据集上的 SER 性能往往更好,为比如 HuBERT X-Large 等更大模型提供了轻量且高效的替代方案。我们的发现凸显了 Whisper 作为 SER 表示提取器的潜力,并证明了注意力池化对维度缩减的有效性。
引用
@article{arxiv.2602.06000,
title = {Speech Emotion Recognition Leveraging OpenAI's Whisper Representations and Attentive Pooling Methods},
author = {Ali Shendabadi and Parnia Izadirad and Mostafa Salehi and Mahmoud Bijankhan},
journal= {arXiv preprint arXiv:2602.06000},
year = {2026}
}