中文

利用 OpenAI Whisper 表示和注意力池化方法的语音情感识别

人工智能 2026-02-10 v1 计算与语言 机器学习 声音

摘要

语音情感识别 (SER) 研究面临数据集标准化和规模不足的限制。最近的研究利用预训练模型提取特征以用于下游任务,如 SER。本工作探讨了 Whisper——一个预训练的语音识别系统——在语音情感识别中的能力,通过提出两种注意力池化方法(多头注意力平均池化和 QKV 池化),高效地降低 Whisper 表示的维度,同时保留情感特征。我们在英语和波斯语上进行实验,分别使用 IEMOCAP 和 ShEMO 数据集,以及 Whisper Tiny 和 Small。我们的多头 QKV 架构在 ShEMO 数据集上实现了状态最佳结果,无加权准确率提升 2.47%。我们进一步比较了不同 Whisper 编码器层的性能,发现中间层在波斯语数据集上的 SER 性能往往更好,为比如 HuBERT X-Large 等更大模型提供了轻量且高效的替代方案。我们的发现凸显了 Whisper 作为 SER 表示提取器的潜力,并证明了注意力池化对维度缩减的有效性。

关键词

引用

@article{arxiv.2602.06000,
  title  = {Speech Emotion Recognition Leveraging OpenAI's Whisper Representations and Attentive Pooling Methods},
  author = {Ali Shendabadi and Parnia Izadirad and Mostafa Salehi and Mahmoud Bijankhan},
  journal= {arXiv preprint arXiv:2602.06000},
  year   = {2026}
}