从语音中学习情感表示
计算与语言
2016-02-16 v6 机器学习
摘要
在语音识别应用的表示学习方面已有大量先前工作,但对于从语音中有效提取情感表示的研究却未给予足够重视,其中语音的副语言元素需与言语内容分离。本文中,我们探索使用去噪自编码器从语音中学习副语言属性,即类别型和维度型情感特征。我们表明,自编码器瓶颈层学习到的表示对激活强度以及将负效价(悲伤和愤怒)与正效价(快乐)分离具有高度判别性。我们尝试了不同的输入语音特征(如带有时间上下文窗口的FFT和对数梅尔谱图),以及不同的自编码器架构(如堆叠自编码器和深度自编码器)。我们还通过结合去噪自编码器和基于BLSTM的循环自编码器学习话语特定表示。利用学习到的时间/动态表示进行情感分类,以评估表示的质量。在一个成熟的真实语音数据集(IEMOCAP)上的实验表明,学习到的表示可与最先进的特性提取器(如嗓音质量特征和MFCC)相媲美,并在情感和维度情感识别上与最先进方法具有竞争力。
引用
@article{arxiv.1511.04747,
title = {Learning Representations of Affect from Speech},
author = {Sayan Ghosh and Eugene Laksana and Louis-Philippe Morency and Stefan Scherer},
journal= {arXiv preprint arXiv:1511.04747},
year = {2016}
}
备注
This is a submission for the ICLR (International Conference on Learning Representations) Workshop 2016