中文

情感语音的语音识别:探讨情绪与语音生成策略的影响

音频与语音处理 2026-01-29 v1

摘要

本文考察情感语音及其生成策略对语音识别系统(ASR)性能的影响。我们分析了来自三种情感 TTS 模型合成语音的行为,发现替代错误占主导,且不同模型之间的情感表达差异显著。基于这些洞察,我们提出两种生成策略:一种基于转录正确性,另一种基于情感显著性,用于构建精细化的微调子集。结果表明,这些策略在真实情感数据集上实现了持续的 WER 改进,而在干净的 LibriSpeech 语料上则未见明显退化。尤其对于富有表现力的语音,联合策略取得了最佳提升。这一发现凸显了针对性数据增强在构建情感感知 ASR 系统中的重要性。

关键词

引用

@article{arxiv.2601.20319,
  title  = {ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy},
  author = {Ya-Tse Wu and Chi-Chun Lee},
  journal= {arXiv preprint arXiv:2601.20319},
  year   = {2026}
}

备注

Accepted for publication at IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) 2025