中文

EMO-SUPERB:深入审视语音情感识别

音频与语音处理 2024-03-13 v4 声音

摘要

语音情感识别(SER)是人机交互系统的关键技术。然而,80.77% 的 SER 论文产生的结果无法复现。我们开发了 EMO-SUPERB(即 EMOtion Speech Universal PERformance Benchmark 的缩写),旨在增强 SER 的开源工作。EMO-SUPERB 包含一个用户友好的代码库,可利用 15 种最先进的语音自监督学习模型(SSLMs)在六个开源 SER 数据集上进行详尽评估。EMO-SUPERB 通过在线排行榜简化结果共享,促进社区驱动基准测试内的协作,从而推动 SER 的发展。平均而言,2.58% 的标注是使用自然语言进行的。SER 依赖分类模型且无法处理自然语言,导致这些有价值的标注被丢弃。我们提示 ChatGPT 模仿标注者,理解自然语言标注,随后重新标记数据。通过使用 ChatGPT 生成的标签,我们在所有设置中始终实现了平均 3.08% 的相对增益。

关键词

引用

@article{arxiv.2402.13018,
  title  = {EMO-SUPERB: An In-depth Look at Speech Emotion Recognition},
  author = {Haibin Wu and Huang-Cheng Chou and Kai-Wei Chang and Lucas Goncalves and Jiawei Du and Jyh-Shing Roger Jang and Chi-Chun Lee and Hung-Yi Lee},
  journal= {arXiv preprint arXiv:2402.13018},
  year   = {2024}
}

备注

webpage: https://emosuperb.github.io/