基于深度视网膜卷积神经网络的语音情感识别突破
声音
2017-08-01 v1 机器学习
摘要
语音情感识别(SER)旨在从语音信号角度研究说话人情感状态的形成与变化,从而使人与计算机之间的交互更加智能。SER 是一项具有挑战性的任务,面临训练数据少和预测准确率低的问题。本文提出一种基于视网膜和凸透镜成像原理的数据增强算法,通过改变频谱图与凸透镜之间的距离,获取不同尺寸的频谱图并增加训练数据量。同时,借助深度学习获取高层特征,我们提出了用于 SER 的深度视网膜卷积神经网络(DRCNNs),并取得了超过 99% 的平均准确率。实验结果表明,DRCNNs 在可识别的情感数量和识别准确率方面均优于以往研究。可以预见,我们的结果将极大改善人机交互。
引用
@article{arxiv.1707.09917,
title = {A breakthrough in Speech emotion recognition using Deep Retinal Convolution Neural Networks},
author = {Yafeng Niu and Dongsheng Zou and Yadong Niu and Zhongshi He and Hua Tan},
journal= {arXiv preprint arXiv:1707.09917},
year = {2017}
}