SEMOUR:乌尔都语脚本化情感语音库
声音
2021-05-20 v1 音频与语音处理
摘要
设计可靠的语音情感识别系统是一项复杂任务,不可避免地需要充足的数据用于训练。此类大规模数据集目前仅以少数几种语言提供,包括英语、德语和意大利语。在本文中,我们提出SEMOUR,这是首个用于设计乌尔都语语音识别系统的、带有情感标注的乌尔都语脚本化语音数据库。我们的性别平衡数据集包含由八位专业演员录制的15040条独特样本,其引出的脚本具有句法复杂性。该数据集在音素上是平衡的,并在实验中由人类评分者间的高一致性分数可靠地展现出多样的情感集合。我们还提供了在该数据库上的多种基线语音情感预测分数,可用于个性化机器人助手、心理疾病诊断以及从低技术普及人群获取反馈等多种应用。在一个随机测试样本上,我们的模型以最先进的92%准确率正确预测情感。
引用
@article{arxiv.2105.08957,
title = {SEMOUR: A Scripted Emotional Speech Repository for Urdu},
author = {Nimra Zaheer and Obaid Ullah Ahmad and Ammar Ahmed and Muhammad Shehryar Khan and Mudassir Shabbir},
journal= {arXiv preprint arXiv:2105.08957},
year = {2021}
}
备注
accepted in CHI 2021