基于DNN-HMM及所提epoch与MFCC特征的说话人自适应情感识别
声音
2021-08-09 v1 人工智能
机器学习
音频与语音处理
摘要
语音是由时变激励源激励时变声道系统而产生的。因此,语音中所包含的信息(如内容、情感、语言、说话人)是激励源与声道系统共同作用的结果。然而,利用激励源特征来识别情感的研究极少。在我们前期的工作中,我们提出了一种提取声门闭合时刻(GCIs,即epochs)的新方法。本文中,我们探究了epoch的特征,即瞬时基频、相位与强度,用于区分不同情感。我们将激励源特征与著名的梅尔频率倒谱系数(MFCC)特征相结合,构建了性能更优的情感识别系统。利用MFCC、epoch及组合特征,我们开发了DNN-HMM说话人自适应模型。评估所用数据库为IEMOCAP情感数据库。单独使用MFCC与epoch特征时,情感识别系统的平均准确率分别为59.25%和54.52%;将二者组合后,识别性能提升至64.2%。
引用
@article{arxiv.1806.00984,
title = {DNN-HMM based Speaker Adaptive Emotion Recognition using Proposed Epoch and MFCC Features},
author = {Md. Shah Fahad and Jainath Yadav and Gyadhar Pradhan and Akshay Deepak},
journal= {arXiv preprint arXiv:1806.00984},
year = {2021}
}