中文

在自然条件挑战中构建面向分类情感预测的顶级框架:从语音基础模型与学习目标到数据增强与工程选择

声音 2025-06-03 v2 音频与语音处理

摘要

语音情感识别 (SER),特别是针对自然表达的情感,仍然是一项具有挑战性的计算任务。关键挑战包括情感标注中固有的主观性以及数据集中情感标签的不均衡分布。本文介绍了为参加 INTERSPEECH 2025 情感识别挑战赛(任务 1)而开发的 SAILER 系统。该挑战赛的数据集包含来自播客的自然情感语音,是研究不均衡和主观情感标注的宝贵资源。我们的系统设计简单、可复现且有效,突出了在建模、学习目标、数据增强和工程选择方面的关键决策。结果表明,即使是单一系统(不使用集成)也能超越 95% 以上的提交,Macro-F1 分数超过 0.4。此外,三个系统的集成进一步提升了性能,取得了具有竞争力的排名分数(排名前三的团队)。我们的模型位于:https://github.com/tiantiaf0627/vox-profile-release。

关键词

引用

@article{arxiv.2505.22133,
  title  = {Developing a Top-tier Framework in Naturalistic Conditions Challenge for Categorized Emotion Prediction: From Speech Foundation Models and Learning Objective to Data Augmentation and Engineering Choices},
  author = {Tiantian Feng and Thanathai Lertpetchpun and Dani Byrd and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2505.22133},
  year   = {2025}
}

备注

Accepted to INTERSPEECH 2025