揭示隐藏因素:面向语音情感识别中特征提升的可解释人工智能
音频与语音处理
2024-06-07 v2 人工智能
计算与语言
机器学习
声音
摘要
语音情感识别(SER)因其在心理健康、教育和人机交互等多个应用领域而受到广泛关注。然而,SER系统的准确性受到高维特征集的阻碍,这些特征集可能包含不相关和冗余的信息。为克服这一挑战,本研究提出了一种迭代特征提升方法,该方法强调特征相关性和可解释性,以提升机器学习模型性能。我们的方法涉及细致的特征选择和分析,以构建高效的SER系统。通过模型可解释性解决主要问题时,我们采用了一个基于Shapley值的特征评估循环,以迭代方式优化特征集。该过程在模型性能和透明度之间取得平衡,从而能够全面理解模型的预测。所提出的方法具有若干优势,包括识别和移除不相关及冗余特征,从而构建更有效的模型。此外,它促进了可解释性,有助于理解模型预测以及识别情感判定的关键特征。该方法在Toronto情感语音集(TESS)、柏林情感语音数据库(EMO-DB)、Ryerson音视频情感语音与歌曲数据库(RAVDESS)以及Surrey音视频表达情感(SAVEE)数据集上的SER基准测试中验证了有效性,性能优于现有最先进方法。据我们所知,这是首个将模型可解释性融入SER框架的工作。本文源代码公开于:https://github.com/alaaNfissi/Unveiling-Hidden-Factors-Explainable-AI-for-Feature-Boosting-in-Speech-Emotion-Recognition。
引用
@article{arxiv.2406.01624,
title = {Unveiling Hidden Factors: Explainable AI for Feature Boosting in Speech Emotion Recognition},
author = {Alaa Nfissi and Wassim Bouachir and Nizar Bouguila and Brian Mishara},
journal= {arXiv preprint arXiv:2406.01624},
year = {2024}
}
备注
Published in: Springer Nature International Journal of Applied Intelligence (2024)