中文

跨语料库语音情感识别与数据增强研究

计算与语言 2022-01-11 v1 声音 音频与语音处理

摘要

在语音情感识别(SER)中,能够处理广泛说话人与声学条件的模型至关重要。这些模型在面临训练时未出现的说话人或声学条件时,往往表现出参差不齐的结果。本文研究了跨语料库数据补充与数据增强对 SER 模型在匹配(测试集来自同一语料库)与非匹配(测试集来自不同语料库)条件下性能的影响。文中给出了基于六个情感语音语料库的研究,这些语料库包含单说话人与多说话人,并在情感风格(表演式、诱发式、自然式)与录制条件上存在差异。观察表明,正如预期,在单一语料库上训练的模型在匹配条件下表现最佳,而在非匹配条件下性能下降 10%–40%,具体取决于语料库特征。在混合语料库上训练的模型在非匹配情境下更稳定,与匹配条件下单一语料库模型相比,性能降幅为 1% 至 8%。数据增强带来最高 4% 的额外提升,且似乎对非匹配条件的裨益大于匹配条件。

关键词

引用

@article{arxiv.2201.03511,
  title  = {A study on cross-corpus speech emotion recognition and data augmentation},
  author = {Norbert Braunschweiler and Rama Doddipatla and Simon Keizer and Svetlana Stoyanchev},
  journal= {arXiv preprint arXiv:2201.03511},
  year   = {2022}
}

备注

Accepted at ASRU 2021