基于MFCC的语音情感识别训练集扩充
计算机视觉与模式识别
2014-03-20 v1
摘要
通过语音进行情绪状态识别是当前非常有趣的研究课题。利用语音的潜意识信息(韵律)可以识别人的情绪状态。自动情绪识别系统设计的主要问题之一是可用模式数量少。这使得学习过程更加困难,因为泛化问题会在这些条件下出现。本文提出一种解决方案,即通过创建新的虚拟模式来扩大训练集。在情绪语音中,大部分情绪信息包含在速度和音高变化中。因此,不改变速度和音高变化的平均音高变化不影响表达的情绪。我们利用这一先验信息,在分类系统的特征提取过程中应用性别相关的音高偏移修改来创建新模式。为此,我们提出对用于情绪分类的梅尔频率倒谱系数进行频率缩放修改。该过程可以合成增加训练集中可用模式的数量,从而提高系统的泛化能力并降低测试误差。使用两种不同泛化能力的分类器进行的结果证明了该方法的适用性。
引用
@article{arxiv.1403.4777,
title = {MFCC based Enlargement of the Training Set for Emotion Recognition in Speech},
author = {Inma Mohino-Herranz and Roberto Gil-Pita and Sagrario Alonso-Diaz and Manuel Rosa-Zurera},
journal= {arXiv preprint arXiv:1403.4777},
year = {2014}
}
备注
Signal & Image Processing : An International Journal (SIPIJ)