中文

语音如何被识别为情感——一项基于信息分解的研究

声音 2021-11-25 v1 音频与语音处理

摘要

人类将情感编码到语音信号中的方式十分复杂。例如,一个愤怒的人可能会提高音调和语速,并使用不礼貌的词语。本文对多种情感因素进行了初步研究,并探讨了每种因素如何影响现代情感识别系统。我们研究的关键工具是最近提出的 SpeechFlow 模型,通过该模型,我们能够将语音信号分解为独立的信息因子(内容、音高、节奏)。基于这种分解,我们仔细研究了每个信息成分及其组合的性能。我们在三个不同的语音情感语料库上进行了研究,并选择了一种基于注意力的卷积 RNN 作为情感分类器。结果表明,节奏是情感表达最重要的成分。此外,跨语料库的结果非常差(甚至比随机猜测还差),表明当前的语音情感识别模型相当脆弱。有趣的是,通过移除一个或几个不重要的成分,跨语料库的结果可以得到改善。这证明了分解方法在实现可泛化情感识别方面的潜力。

关键词

引用

@article{arxiv.2111.12324,
  title  = {How Speech is Recognized to Be Emotional - A Study Based on Information Decomposition},
  author = {Haoran Sun and Lantian Li and Thomas Fang Zheng and Dong Wang},
  journal= {arXiv preprint arXiv:2111.12324},
  year   = {2021}
}