中文

BANSpEmo:一个孟加拉语情感语音识别数据集

人机交互 2023-12-22 v1 机器学习 声音 音频与语音处理

摘要

在音频和语音分析领域,从声学信号中识别情感的能力至关重要。区分语音信号中情感的能力在人机交互 (HCI) 和行为分析等众多领域有着广泛的应用。在此,我们推出了 BanSpEmo,这是一个专为孟加拉语创建的情感语音语料库,仅包含音频录音。该语料库包含 792 段音频录音,总时长超过 1 小时 23 分钟。22 名母语者参与了录音,录制了两组代表六种目标情感的句子。数据集由 12 个孟加拉语句子组成,分别以厌恶、快乐、悲伤、惊讶、愤怒和恐惧六种情感说出。该语料库在性别上也不平衡。十位具有相关领域经验或表演经验的个人参与了对该语料库的评估。它在每个情感类别中拥有平衡数量的音频录音。BanSpEmo 可被视为促进孟加拉语情感和语音识别研究及相关应用的有用资源。数据集可在以下网址找到:https://data.mendeley.com/datasets/rdwn4bs5ky,并可用于学术研究。

关键词

引用

@article{arxiv.2312.14020,
  title  = {BANSpEmo: A Bangla Emotional Speech Recognition Dataset},
  author = {Md Gulzar Hussain and Mahmuda Rahman and Babe Sultana and Ye Shiren},
  journal= {arXiv preprint arXiv:2312.14020},
  year   = {2023}
}