中文

基于多层感知机与支持向量机的语音与歌曲情感识别

声音 2021-05-21 v1 机器学习 音频与语音处理

摘要

在此,我们比较了 SVM 与 MLP 在利用 RAVDESS 数据集的语音与歌曲通道进行情感识别时的性能。我们经历了一系列过程以提取各类音频特征,并确定模型的最优缩放策略与超参数。为增加样本量,我们进行了音频数据增强,并使用 SMOTE 处理数据不平衡。我们的数据显示,优化后的 SVM 以 82% 准确率优于 MLP 的 75%。数据增强后,两种算法性能一致约为 79%,但 SVM 出现过拟合现象。我们最后的探索表明,SVM 与 MLP 性能相近,二者在语音通道的准确率均低于歌曲通道。我们的发现表明,SVM 与 MLP 均是依赖于发声方式的强大情感识别分类器。

关键词

引用

@article{arxiv.2105.09406,
  title  = {Speech & Song Emotion Recognition Using Multilayer Perceptron and Standard Vector Machine},
  author = {Behzad Javaheri},
  journal= {arXiv preprint arXiv:2105.09406},
  year   = {2021}
}