中文

跨语料多语言语音情感识别:阿姆哈拉语与其他语言对比

计算与语言 2023-07-21 v1 神经与进化计算 声音 音频与语音处理

摘要

在常规语音情感识别(SER)任务中,给定语言的分类器是在该语言已有数据集上训练的。然而,当某语言训练数据不存在时,可使用其他语言的数据替代。我们实验了跨语言与多语言SER,涉及阿姆哈拉语、英语、德语和乌尔都语。对阿姆哈拉语,我们使用自己公开可用的阿姆哈拉语语音情感数据集(ASED)。对英语、德语和乌尔都语,我们使用现有RAVDESS、EMO-DB和URDU数据集。我们遵循先前研究将所有数据集标签映射为仅两类:积极与消极。因此可直接比较不同语言上的性能,并组合语言进行训练与测试。实验1中,使用AlexNet、VGGE(VGG的拟议变体)和ResNet50三种分类器进行单语SER试验。三模型平均结果在ASED和RAVDESS上非常相似,表明阿姆哈拉语与英语SER难度相当。类似地,德语SER更难,乌尔都语SER更易。实验2中,我们在一语言上训练并在另一语言上测试,对每对语言双向进行:阿姆哈拉语<->德语、阿姆哈拉语<->英语、阿姆哈拉语<->乌尔都语。以阿姆哈拉语为目标的结果表明,使用英语或德语作源语言将给出最佳结果。实验3中,我们在多种非阿姆哈拉语上训练然后在阿姆哈拉语上测试。获得的最佳准确率比实验2最佳准确率高出几个百分点,表明使用两种或三种非阿姆哈拉语训练比仅用一种非阿姆哈拉语可获得更好结果。总体而言,结果表明当某语言资源稀缺时,跨语言与多语言训练可作为训练SER分类器的有效策略。

关键词

引用

@article{arxiv.2307.10814,
  title  = {Cross-Corpus Multilingual Speech Emotion Recognition: Amharic vs. Other Languages},
  author = {Ephrem Afele Retta and Richard Sutcliffe and Jabar Mahmood and Michael Abebe Berwo and Eiad Almekhlafi and Sajjad Ahmed Khan and Shehzad Ashraf Chaudhry and Mustafa Mhamed and Jun Feng},
  journal= {arXiv preprint arXiv:2307.10814},
  year   = {2023}
}

备注

16 pages, 9 tables, 5 figures