基于自监督学习特征的语音情感识别与语音活动检测端到端集成
计算与语言
2025-06-03 v4
摘要
语音情感识别(SER)通常依赖语音活动检测(VAD)模型检测的语音片段。然而,VAD 模型在噪声环境下可能输出错误的语音片段,导致后续 SER 模型性能下降。为此,我们提出一种端到端(E2E)方法,将 VAD 和 SER 集成使用自监督学习(SSL)特征。VAD 模块首先接收 SSL 特征作为输入,分割后的 SSL 特征随后输入 SER 模块。VAD 和 SER 模块进行联合训练,以优化 SER 性能。在 IEMOCAP 数据集上的实验表明,我们的方法显著提升了 SER 性能。此外,为探讨我们方法对 VAD 和 SSL 模块的影响,我们对 VAD 输出和每个 SSL 编码器层的权重进行了分析。
引用
@article{arxiv.2410.13281,
title = {BanTH: A Multi-label Hate Speech Detection Dataset for Transliterated Bangla},
author = {Fabiha Haider and Fariha Tanjim Shifat and Md Farhan Ishmam and Deeparghya Dutta Barua and Md Sakib Ul Rahman Sourove and Md Fahim and Md Farhad Alam},
journal= {arXiv preprint arXiv:2410.13281},
year = {2025}
}
备注
Published in NAACL Findings 2025