中文

通过微调预训练模型和超参数优化提升语音情感识别

机器学习 2025-10-09 v1

摘要

我们提出了一种语音情感识别 (SER) 的工作流程,将预训练表示与自动化超参数优化 (HPO) 结合。使用 SpeechBrain wav2vec2-base 模型在 IEMOCAP 上微调作为编码器,我们比较了两种 HPO 策略,即高斯过程贝叶斯优化 (GP-BO) 和树结构 Parzen 估计 (TPE),在相同的四维搜索空间和 15 次试验预算下,以德国 EmoDB 语料库上的平衡类准确率 (BCA) 作为目标。所有实验在 8 个 CPU 核心、32 GB RAM 上进行。GP-BO 在 11 分钟内实现 0.96 的 BCA,TPE (Hyperopt 实现) 在 15 分钟内达到 0.97。相比,网格搜索需要 143 次试验和 1,680 分钟才能超过 0.9 BCA,最佳的 AutoSpeech 2020 基线在 GPU 上仅用 30 分钟报告了 0.85 的准确率。对于跨语言泛化,基于 EmoDB 训练的 HPO 调优模型在 CREMA-D 上的零样本准确率提高了 0.25,在 RAVDESS 上的准确率提高了 0.26。结果表明,使用预训练编码器进行高效 HPO 能在普通 CPU 上实现竞争性的 SER 性能。本工作的源码可在 https://github.com/youngaryan/speechbrain-emotion-hpo 获取。

关键词

引用

@article{arxiv.2510.07052,
  title  = {Enhancing Speech Emotion Recognition via Fine-Tuning Pre-Trained Models and Hyper-Parameter Optimisation},
  author = {Aryan Golbaghi and Shuo Zhou},
  journal= {arXiv preprint arXiv:2510.07052},
  year   = {2025}
}