融合递归动力学用于语音情感识别
声音
2018-11-13 v1 机器学习
音频与语音处理
机器学习
摘要
我们研究了能够捕捉语音信号中嵌入的非线性递归动力学的特征在语音情感识别(SER)任务上的性能。对每个语音帧的相空间进行重构并计算其各自的递归图(RP),揭示了可通过递归量化分析(RQA)度量的复杂结构。这些度量通过段和话语周期上的统计泛函进行聚合。我们报告了使用不同分类方法在三个数据库上所提特征集的SER结果。当将所提特征与传统特征集融合时,我们在说话人相关(SD)和说话人无关(SI)SER任务上分别较基线实现了未加权准确率最高5.7%和10.7%的提升。遵循基于段的方法,我们利用双向循环神经网络在IEMOCAP上展示了最先进的性能。
引用
@article{arxiv.1811.04133,
title = {Integrating Recurrence Dynamics for Speech Emotion Recognition},
author = {Efthymios Tzinis and Georgios Paraskevopoulos and Christos Baziotis and Alexandros Potamianos},
journal= {arXiv preprint arXiv:1811.04133},
year = {2018}
}