中文

LSSED:面向语音情感识别的大规模数据集与基准

声音 2021-02-04 v1 人工智能 计算与语言

摘要

语音情感识别是下一代人机交互(HCI)的重要促成因素。然而,当前现有的小规模数据库限制了相关研究的进展。本文提出 LSSED,一个具有挑战性的大规模英文语音情感数据集,其数据收集自 820 名受试者以模拟真实世界分布。此外,我们发布了基于 LSSED 的一些预训练模型,其不仅能促进语音情感识别的发展,也可迁移至相关下游任务,如数据极难收集的心理健康发展分析。最后,我们的实验显示了大规模数据集的必要性及预训练模型的有效性。该数据集将于 https://github.com/tobefans/LSSED 发布。

关键词

引用

@article{arxiv.2102.01754,
  title  = {LSSED: a large-scale dataset and benchmark for speech emotion recognition},
  author = {Weiquan Fan and Xiangmin Xu and Xiaofen Xing and Weidong Chen and Dongyan Huang},
  journal= {arXiv preprint arXiv:2102.01754},
  year   = {2021}
}