中文

利用动态频谱特征和卡尔曼平滑增强语音情感识别

声音 2026-01-28 v1 机器学习 音频与语音处理

摘要

语音情感识别系统通常使用静态特征,如梅尔频率倒谱系数(MFCC)、过零率(ZCR)和均方根能量(RMSE)。因此,当语音信号中存在声学噪声时,它们可能会错误分类情感。为了解决这个问题,我们使用动态频谱特征(Delta和Delta-Delta)以及卡尔曼平滑算法添加了动态特征。这种方法减少了噪声并改善了情感分类。由于情感随时间变化,卡尔曼平滑滤波器也有助于使分类器输出更稳定。在RAVDESS数据集上的测试表明,该方法达到了87%的最先进准确率,并减少了具有相似声学特征的情感之间的错误分类。

关键词

引用

@article{arxiv.2601.18908,
  title  = {Enhancing Speech Emotion Recognition using Dynamic Spectral Features and Kalman Smoothing},
  author = {Marouane El Hizabri and Abdelfattah Bezzaz and Ismail Hayoukane and Youssef Taki},
  journal= {arXiv preprint arXiv:2601.18908},
  year   = {2026}
}