面向噪声鲁棒的语音情感识别的可解释 Transformer-CNN 深合
声音
2025-12-23 v1 计算与语言
摘要
语音情感识别(SER)系统在面对现实环境中不可预测的声学干扰时往往表现性能下降。此外,深度学习模型的不透明性阻碍了其在信任关键应用中的采用。为弥合这一差距,我们提出了一种混合 Transformer-CNN 框架,将 Wav2Vec 2.0 的上下文建模与 1D 卷积神经网络的谱稳定性统一。该双流体系结构处理原始波形以捕获长程时序依赖,同时通过自定义的注意力时序池化机制提取噪声抗性谱特征(MFCC、ZCR、RMSE)。我们在四个多样化基准数据集上进行了广泛验证:RAVDESS、TESS、SAVEE 和 CREMA-D。为严格测试鲁棒性,我们将模型置于来自 SAS-KIIT 数据集的真实世界噪声轮廓的非平稳声学干扰下。该提议框架在所有数据集上均显示出优越的泛化能力和状态的体现准确率,显著优于现有单分支基线,在现实环境干扰下表现更佳。此外,我们通过整合 SHAP 和 Score-CAM 解决“黑箱”问题。这些工具提供细粒度的可视化解释,揭示模型在复杂环境噪声存在时,如何 strategically 转移注意力在时序和谱线索以维持可靠性。
引用
@article{arxiv.2512.18298,
title = {Explainable Transformer-CNN Fusion for Noise-Robust Speech Emotion Recognition},
author = {Sudip Chakrabarty and Pappu Bishwas and Rajdeep Chatterjee},
journal= {arXiv preprint arXiv:2512.18298},
year = {2025}
}