基于四元数卷积神经网络的语音情感识别
声音
2021-11-02 v1 计算与语言
音频与语音处理
摘要
尽管语音识别已成为一项广泛使用的技术,但从语音信号中推断情感仍然是一项挑战。为解决此问题,本文提出一种基于四元数卷积神经网络(QCNN)的语音情感识别(SER)模型,其中语音信号的梅尔谱图特征被编码于 RGB 四元数域中。我们表明,基于 QCNN 的 SER 模型在 Ryerson Audio-Visual Database of Emotional Speech and Song(RAVDESS,8 类)数据集中优于其他实值方法,据我们所知取得了最先进(state-of-the-art)的结果。该 QCNN 在 Interactive Emotional Dyadic Motion Capture(IEMOCAP 4 类)和 Berlin EMO-DB(7 类)数据集中也取得了与最先进方法相当的结果。具体而言,该模型在 RAVDESS、IEMOCAP 和 EMO-DB 数据集上的准确率分别为 77.87%、70.46% 和 88.78%。此外,我们的结果表明,与其他方法相比,四元数单位结构能够更好地编码内部依赖关系,从而显著减小模型规模。
引用
@article{arxiv.2111.00404,
title = {Speech Emotion Recognition Using Quaternion Convolutional Neural Networks},
author = {Aneesh Muppidi and Martin Radfar},
journal= {arXiv preprint arXiv:2111.00404},
year = {2021}
}
备注
Published in ICASSP 2021