中文

SER模型跨数据集泛化需要什么?——全面基准研究

声音 2024-06-17 v1 人工智能 人机交互 机器学习

摘要

语音情感识别(SER)对于增强基于语音的应用程序中的人机交互至关重要。尽管在特定情感数据集上取得了改进,但SER在现实世界情境下的泛化能力仍存在研究空白。本文探讨了如何实现SER系统跨不同情感数据集的泛化。在本研究中,我们纳入了11个情感语音数据集,并对SER任务进行全面基准测试。我们还通过在组合SER数据集进行训练时使用过采样方法来解决数据分布不平衡的问题。此外,我们探索了各种评估协议,以适应SER的泛化能力。基于此,我们进一步探讨了Whisper用于SER的潜力,强调彻底评估的重要性。本方法旨在通过整合speaker-independent方法来推动SER技术的发展。

关键词

引用

@article{arxiv.2406.09933,
  title  = {What Does it Take to Generalize SER Model Across Datasets? A Comprehensive Benchmark},
  author = {Adham Ibrahim and Shady Shehata and Ajinkya Kulkarni and Mukhtar Mohamed and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2406.09933},
  year   = {2024}
}

备注

ACCEPTED AT INTERSPEECH 2024, GREECE