LSSED:面向语音情感识别的大规模数据集与基准
声音
2021-02-04 v1 人工智能
计算与语言
摘要
语音情感识别是下一代人机交互(HCI)的重要促成因素。然而,当前现有的小规模数据库限制了相关研究的进展。本文提出 LSSED,一个具有挑战性的大规模英文语音情感数据集,其数据收集自 820 名受试者以模拟真实世界分布。此外,我们发布了基于 LSSED 的一些预训练模型,其不仅能促进语音情感识别的发展,也可迁移至相关下游任务,如数据极难收集的心理健康发展分析。最后,我们的实验显示了大规模数据集的必要性及预训练模型的有效性。该数据集将于 https://github.com/tobefans/LSSED 发布。
引用
@article{arxiv.2102.01754,
title = {LSSED: a large-scale dataset and benchmark for speech emotion recognition},
author = {Weiquan Fan and Xiangmin Xu and Xiaofen Xing and Weidong Chen and Dongyan Huang},
journal= {arXiv preprint arXiv:2102.01754},
year = {2021}
}