中文

ASR 表征用于噪声鲁棒语音情感识别的有效性综合研究

声音 2026-01-13 v4 计算与语言 音频与语音处理

摘要

本文针对噪声语音情感识别(NSER)提出了一种高效尝试。传统 NSER 方法在减轻白高斯噪声等人造噪声源影响方面已被证明有效,但由于真实环境中非平稳噪声的复杂性与不确定性而受限。为克服该局限,我们引入一种 NSER 新方法,采用自动语音识别(ASR)模型作为噪声鲁棒特征提取器以消除噪声语音中的非语音信息。我们首先从 ASR 模型获取中间层信息作为情感语音的特征表征,然后将该表征用于下游 NSER 任务。实验结果表明:1) 所提方法相较传统降噪方法取得更优 NSER 性能;2) 优于自监督学习方法;3) 甚至优于使用 ASR 转写或噪声语音真值转写的基于文本的方法。

关键词

引用

@article{arxiv.2311.07093,
  title  = {A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition},
  author = {Xiaohan Shi and Jiajun He and Xingfeng Li and Tomoki Toda},
  journal= {arXiv preprint arXiv:2311.07093},
  year   = {2026}
}

备注

Accepted for publication in IEEE Transactions on Audio, Speech, and Language Processing