中文

ShEMO——一个用于波斯语语音情感检测的大规模已校验数据库

计算与语言 2019-06-12 v3 声音 音频与语音处理

摘要

本文介绍一个称为 Sharif 情感语音数据库(ShEMO)的大规模已校验波斯语数据库。该数据库包含 3000 条半自然语句,相当于从在线广播剧中抽取的 3 小时 25 分钟语音数据。ShEMO 覆盖 87 位波斯语母语者的语音样本,涉及愤怒、恐惧、高兴、悲伤、惊讶五种基本情绪以及中性状态。十二位标注者对语句的潜在情绪状态进行标注,并采用多数投票决定最终标签。根据 kappa 度量,标注者间一致性为 64%,被解读为“实质性一致”。我们还基于语音情感检测任务中的常见分类方法给出基准结果。根据实验,支持向量机在性别无关(58.2%)与性别相关模型(女=59.4%,男=57.6%)上均取得最佳结果。ShEMO 免费提供给学术界使用,以期为波斯语情感语音的进一步研究提供基线。

关键词

引用

@article{arxiv.1906.01155,
  title  = {ShEMO -- A Large-Scale Validated Database for Persian Speech Emotion Detection},
  author = {Omid Mohamad Nezami and Paria Jamshid Lou and Mansoureh Karami},
  journal= {arXiv preprint arXiv:1906.01155},
  year   = {2019}
}