中文

经验教训:重新审视面向自然场景语音情感识别的关键训练策略

音频与语音处理 2025-09-26 v2

摘要

本研究重新审视机器学习中常被更深层架构所忽视的关键训练策略。具体而言,我们探索平衡策略、激活函数和微调技术,以提高自然环境下语音情感识别(SER)的表现。我们的发现表明,简单修改即可在最小化架构变更的情况下提升泛化能力。我们的多模态融合模型整合了这些优化措施,实现了 valence CCC 为0.6953,是Task 2:情感属性回归中最佳的 valence 分数。值得注意的是,在单模态设置下单独微调RoBERTa和WavLM,然后在不训练特征提取器 Backbone 的情况下进行特征融合,可获得最佳的 valence 性能。此外,焦点损失和激活函数在不增加复杂度的情况下显著提升性能。这些结果表明,细化核心组件而非加深模型,可实现更稳健的SER in-the-wild。

关键词

引用

@article{arxiv.2508.07282,
  title  = {Lessons Learnt: Revisit Key Training Strategies for Effective Speech Emotion Recognition in the Wild},
  author = {Jing-Tong Tzeng and Bo-Hao Su and Ya-Tse Wu and Hsing-Hang Chou and Chi-Chun Lee},
  journal= {arXiv preprint arXiv:2508.07282},
  year   = {2025}
}

备注

Proceedings of Interspeech 2025