中文

用于语音情感识别的混合数据增强与基于深度注意力扩张卷积-循环神经网络

声音 2021-09-21 v1 人机交互 机器学习 音频与语音处理

摘要

语音情感识别(SER)一直是人机交互(HCI)应用中的重要任务之一。然而,难以选择最优特征并处理标注数据不平衡的问题。本文研究基于传统方法和生成对抗网络(GAN)方法的混合数据增强(HDA)方法,以生成并平衡数据。为评估 HDA 方法的有效性,设计了一个名为 ADCRNN 的深度学习框架,通过融合深度扩张卷积-循环神经网络与注意力机制实现。此外,我们选择三维对数梅尔频谱图(MelSpec)特征作为该深度学习框架的输入。进而,我们结合 softmax 损失与中心损失重新配置损失函数以分类情感。为验证所提方法,我们使用包含若干类不平衡样本情感的 EmoDB 数据集。实验结果表明,所提方法在 EmoDB 上取得了优于最先进方法的准确率,传统方法与基于 GAN 的方法分别达到 87.12% 和 88.47%。

关键词

引用

@article{arxiv.2109.09026,
  title  = {Hybrid Data Augmentation and Deep Attention-based Dilated Convolutional-Recurrent Neural Networks for Speech Emotion Recognition},
  author = {Nhat Truong Pham and Duc Ngoc Minh Dang and Sy Dzung Nguyen},
  journal= {arXiv preprint arXiv:2109.09026},
  year   = {2021}
}

备注

12 pages, 16 figures, 6 tables