中文

一个新的阿姆哈拉语语音情感数据集与分类基准

计算与语言 2022-01-11 v1 声音 音频与语音处理

摘要

本文我们提出阿姆哈拉语语音情感数据集 (ASED),它涵盖四种方言(Gojjam、Wollo、Shewa 和 Gonder)和五种不同的情感(中性、恐惧、高兴、悲伤和愤怒)。我们相信这是首个阿姆哈拉语语音情感识别 (SER) 数据集。65 名志愿者参与者,均为母语者,录制了 2,474 个时长两到四秒的音频样本。八名评判员为样本标注情感,具有高度一致性(Fleiss kappa = 0.8)。所得数据集可免费下载。接下来,我们开发了知名 VGG 模型的一个四层变体,称之为 VGGb。随后使用 VGGb 在 ASED 上进行了三项 SER 实验。首先,我们研究梅尔谱图特征或梅尔频率倒谱系数 (MFCC) 特征对阿姆哈拉语是否有效。通过对 ASED 训练两个 VGGb SER 模型实现:一个使用梅尔谱图,另一个使用 MFCC。尝试了四种训练形式:标准交叉验证,以及基于句子、方言和说话人组的三种变体。因此,用于训练的句子不会用于测试,方言和说话人组同理。结论是 MFCC 特征在所有四种训练方案下均更优。因此实验 2 采用 MFCC,在 ASED 上比较 VGGb 与另外三个已有模型:RESNet50、Alex-Net 和 LSTM。发现 VGGb 具有非常好的准确率 (90.73%) 以及最快的训练时间。实验 3 中,比较了 VGGb 在两个已有 SER 数据集 RAVDESS(英语)和 EMO-DB(德语)以及 ASED(阿姆哈拉语)上训练时的性能。跨语言结果可比,其中 ASED 最高。这表明 VGGb 可成功应用于其他语言。我们希望 ASED 能鼓励研究者尝试其他模型用于阿姆哈拉语 SER。

关键词

引用

@article{arxiv.2201.02710,
  title  = {A New Amharic Speech Emotion Dataset and Classification Benchmark},
  author = {Ephrem A. Retta and Eiad Almekhlafi and Richard Sutcliffe and Mustafa Mhamed and Haider Ali and Jun Feng},
  journal= {arXiv preprint arXiv:2201.02710},
  year   = {2022}
}

备注

16 pages, 12 tables, 6 figures