利用基于蝠鲼的特征选择优化语音情感识别
声音
2020-09-21 v1 机器学习
音频与语音处理
摘要
从音频信号中识别情感在信号处理中被视为一项具有挑战性的任务,因为它可被视为静态与动态分类任务的集合。从语音数据中识别情感严重依赖于使用机器学习模型进行端到端特征提取与分类,尽管特征选择与优化的缺失限制了这些方法的性能。近期研究表明,梅尔频率倒谱系数(MFCC)已成为最可靠的特征提取方法之一,但其特征维度极小,限制了分类准确率。在本文中,我们提出将使用不同现有特征提取方法提取的特征进行拼接,不仅能提升分类准确率,还能拓展高效特征选择的可能性。除 MFCC 特征提取方法外,我们在特征合并前还使用了线性预测编码(LPC)。此外,我们在语音情感识别任务中新颖地应用了蝠鲼优化,取得了该领域最先进的结果。我们使用两个公开数据集 SAVEE 和 Emo-DB 评估了模型的性能。我们提出的方法在语音情感分析中优于所有现有方法,并在这两个数据集上取得了可观的结果,分类准确率分别为 97.06% 和 97.68%。
引用
@article{arxiv.2009.08909,
title = {Optimizing Speech Emotion Recognition using Manta-Ray Based Feature Selection},
author = {Soham Chattopadhyay and Arijit Dey and Hritam Basak},
journal= {arXiv preprint arXiv:2009.08909},
year = {2020}
}
备注
10 pages, 8 figures