中文

关于后运动语音下声学基础模型鲁棒性的调查

声音 2026-03-31 v1

摘要

自动语音识别 (ASR) 在中性和稳态语音方面已广泛研究,但其在后运动生理变化下的鲁棒性仍未得到充分探索。与休息语音相比,后运动语音常包含微小呼吸、非语义停顿、声振不稳定以及因呼气支撑不足而导致的重复,使得转录更加困难。本文在统一的评估协议下对声学基础模型进行基准测试。我们比较了序列到序列模型 (Whisper 和 FunASR/Paraformer) 和基于 CTC 解码的自监督编码器 (Wav2Vec2、HuBERT 和 WavLM),分别在即插即用推理和后运动领域内微调两种情况下进行评估。在 Static/Post-All 基准中,大多数模型在后运动语音上表现下降,而 FunASR 在 Post-All 上显示出最强的基线鲁棒性,分别为 14.57% WER 和 8.21% CER。微调显著改进了若干 CTC 基于模型,而 Whisper 的适应性则不稳定。作为探索性案例研究,我们进一步按流畅与非流畅说话者对结果进行分层;尽管非流畅子集较小,但始终比流畅子集更具挑战性。总体而言,我们的发现表明,后运动 ASR 的鲁棒性高度依赖于模型,领域内适应性在某些情况下非常有效但并非在所有情况下都稳定,未来的后运动 ASR 研究应明确区分流畅性相关效应与运动诱导的语音变化。

关键词

引用

@article{arxiv.2603.27508,
  title  = {Investigation on the Robustness of Acoustic Foundation Models on Post Exercise Speech},
  author = {Xiangyuan Xue and Yuyu Wang and Ruijie Yao and Xiaoyue Ni and Xiaofan Jiang and Jingping Nie},
  journal= {arXiv preprint arXiv:2603.27508},
  year   = {2026}
}