中文

基于深度稀疏自编码器极限学习机结合新加权方案与谱时特征及经典特征选择和新型量子启发降维方法的语音情感识别

声音 2021-11-16 v1 机器学习 音频与语音处理

摘要

情感计算在人与机器关系中十分重要。本文提出一种基于语音信号的语音情感识别(SER)系统,其在处理的不同阶段使用了新技术。系统由三个阶段组成:特征提取、特征选择和最终的特征分类。在第一阶段,利用韵律、频谱和谱时特征等新颖多样特征的组合,从语音信号和声门波形信号中提取一组复杂的长期统计特征。SER 系统的挑战之一是区分相关情感。这些特征对语音情感是良好的判别器,并提升 SER 识别相似与不同情感的能力。这一具有大量维度的特征向量自然存在冗余。在第二阶段,使用经典特征选择技术以及一种新型量子启发技术来降低特征向量维度,从而减少特征向量维数。在第三阶段,优化后的特征向量由加权深度稀疏极限学习机(ELM)分类器分类。该分类器分三步执行分类:稀疏随机特征学习、使用奇异值分解(SVD)技术的正交随机投影,以及最后一步使用广义 Tikhonov 正则化技术的判别分类。此外,许多现有情感数据集存在数据不平衡分布问题,这反过来增加分类误差并降低系统性能。本文还提出一种新加权方法以应对类不平衡,其比现有加权方法更高效。所提方法在三个标准情感数据库上进行了评估。

关键词

引用

@article{arxiv.2111.07094,
  title  = {Speech Emotion Recognition Using Deep Sparse Auto-Encoder Extreme Learning Machine with a New Weighting Scheme and Spectro-Temporal Features Along with Classical Feature Selection and A New Quantum-Inspired Dimension Reduction Method},
  author = {Fatemeh Daneshfar and Seyed Jahanshah Kabudian},
  journal= {arXiv preprint arXiv:2111.07094},
  year   = {2021}
}