中文

用于语音情感识别的深度残差局部特征学习

声音 2020-11-20 v1 计算与语言 音频与语音处理

摘要

语音情感识别(SER)在当今全球商业中正成为提升服务效率的关键角色,如呼叫中心服务。近期的 SER 基于深度学习方法。然而,深度学习的效率取决于层数,即层越深效率越高。另一方面,更深的层会导致梯度消失问题、低学习率和高耗时。因此,本文提出对现有局部特征学习块(LFLB)的重新设计。新设计称为深度残差局部特征学习块(DeepResLFLB)。DeepResLFLB 由三个级联块组成:LFLB、残差局部特征学习块(ResLFLB)和多层感知机(MLP)。LFLB 用于沿提取层次相关性学习局部相关性;DeepResLFLB 可利用残差学习在更深层中通过重复学习解释更多细节,以解决梯度消失和减少过拟合;MLP 用于发现学习关系并预测语音情感和性别类型的概率。基于两个已发布的公开数据集:EMODB 和 RAVDESS,所提出的 DeepResLFLB 在标准指标(准确率、精确率、召回率和 F1 分数)评估下可显著提升性能。

关键词

引用

@article{arxiv.2011.09767,
  title  = {Deep Residual Local Feature Learning for Speech Emotion Recognition},
  author = {Sattaya Singkul and Thakorn Chatchaisathaporn and Boontawee Suntisrivaraporn and Kuntpong Woraratpanya},
  journal= {arXiv preprint arXiv:2011.09767},
  year   = {2020}
}

备注

12 pages, 5 figures, submitted for review