中文

基于四元数非线性回声状态网络的语音情感识别系统

声音 2021-11-16 v1 音频与语音处理

摘要

回声状态网络(ESN)是展示动态数据的一种强大且高效的工具。然而,许多现有ESN在恰当建模高维数据方面存在局限。这些网络最重要的局限在于其储备池结构导致的高内存消耗,这阻碍了储备池单元的增加以及此类网络特殊能力的最大化利用。解决该问题的一种方法是使用四元数代数。由于四元数具有四个不同维度,高维数据可被轻松表示,并且利用哈密顿乘法,以比实数更少的参数,使多维特征间的外部关联更易建立。除ESN网络中的内存问题外,ESN网络的线性输出对其处理能力构成了难以描述的限制,因为它无法有效利用储备池神经元非线性动力学所提供的特征高阶统计信息。本研究提出一种基于ESN的新结构,其中使用四元数代数通过简单分割函数压缩网络数据,并将输出线性组合器替换为多维双线性滤波器。该滤波器将用于ESN输出层的非线性计算。此外,采用二维主成分分析技术减少传输至双线性滤波器的数据量。本研究中,四元数非线性ESN(QNESN)的系数与权重使用遗传算法进行优化。为证明所提模型相较先前方法的有效性,在EMODB、SAVEE和IEMOCAP语音情感数据集上进行了语音情感识别实验。对比表明,所提QNESN网络优于ESN及大多数当前SER系统。

关键词

引用

@article{arxiv.2111.07234,
  title  = {Speech Emotion Recognition System by Quaternion Nonlinear Echo State Network},
  author = {Fatemeh Daneshfar and Seyed Jahanshah Kabudian},
  journal= {arXiv preprint arXiv:2111.07234},
  year   = {2021}
}