用于语音情感识别的多通道自编码器
声音
2018-10-26 v1 音频与语音处理
摘要
从用户查询中推断情绪状态对提升语音对话应用的能力具有重要作用。尽管若干相关工作已取得满意结果,性能仍可进一步提升。本文提出一种名为多通道自编码器(MTC-AE)的新框架,用于基于声学信息的情感识别。MTC-AE 包含多个基于不同低级描述符与不同统计函数的局部 DNN,这些局部 DNN 部分地拼接在一起,使该结构能同时考虑局部与全局特征。基于基准数据集 IEMOCAP 的实验表明,我们的方法显著优于现有最先进(state-of-the-art)结果,取得 的留一说话人非加权准确率,比该数据集上的最佳结果高 。
引用
@article{arxiv.1810.10662,
title = {Multi-Channel Auto-Encoder for Speech Emotion Recognition},
author = {Zefang Zong and Hao Li and Qi Wang},
journal= {arXiv preprint arXiv:1810.10662},
year = {2018}
}