TRNet:利用语音增强实现噪声鲁棒语音情感识别的双层优化网络
声音
2024-09-04 v2 机器学习
音频与语音处理
摘要
语音情感识别(SER)中一个持续的挑战是无处不在的环境噪声,这在实践中常常导致 SER 性能下降。在本文中,我们引入了一种双层优化网络,称为 TRNet,以应对这一挑战。具体而言,采用了一个预训练的语音增强模块用于前端降噪和噪声水平估计。随后,我们利用纯净语音频谱图及其对应的深度表示作为参考信号,在模型训练期间优化增强语音的频谱图失真和表示偏移。实验结果验证了所提出的 TRNet 在匹配和非匹配噪声环境中均显著提升了系统的鲁棒性,且未损害其在无噪声环境中的性能。
引用
@article{arxiv.2404.12979,
title = {TRNet: Two-level Refinement Network leveraging Speech Enhancement for Noise Robust Speech Emotion Recognition},
author = {Chengxin Chen and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2404.12979},
year = {2024}
}
备注
14 pages, 3 figures