ASR 表征用于噪声鲁棒语音情感识别的有效性综合研究
声音
2026-01-13 v4 计算与语言
音频与语音处理
摘要
本文针对噪声语音情感识别(NSER)提出了一种高效尝试。传统 NSER 方法在减轻白高斯噪声等人造噪声源影响方面已被证明有效,但由于真实环境中非平稳噪声的复杂性与不确定性而受限。为克服该局限,我们引入一种 NSER 新方法,采用自动语音识别(ASR)模型作为噪声鲁棒特征提取器以消除噪声语音中的非语音信息。我们首先从 ASR 模型获取中间层信息作为情感语音的特征表征,然后将该表征用于下游 NSER 任务。实验结果表明:1) 所提方法相较传统降噪方法取得更优 NSER 性能;2) 优于自监督学习方法;3) 甚至优于使用 ASR 转写或噪声语音真值转写的基于文本的方法。
关键词
引用
@article{arxiv.2311.07093,
title = {A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition},
author = {Xiaohan Shi and Jiajun He and Xingfeng Li and Tomoki Toda},
journal= {arXiv preprint arXiv:2311.07093},
year = {2026}
}
备注
Accepted for publication in IEEE Transactions on Audio, Speech, and Language Processing