中文

关于标记级建模中难题:语病与流畅性塑造性状

音频与语音处理 2025-12-03 v1 人工智能 计算与语言 机器学习

摘要

自动转录带有语病的语音仍是挑战,即使对于现代端到端 (E2E) 自动语音识别 (ASR) 框架也是如此。语病和流畅性塑造性状常被忽视,导致非逐字转录,限制了其临床和研究价值。我们提出一种参数高效的适配方法,将语病和流畅性修改解码为转录中的特殊标记,在模拟 (LibriStutter, 英文) 和真实 (KSoF, 德文) 语病语音数据集上进行评估。为缓解 ASR 性能差异和对英文的偏见,我们引入一种多步骤微调策略,结合语言自适应预训练。分词分析进一步突显了分词器的英文中心偏差,这对提高德语数据表现提出了挑战。我们的发现表明,轻量级适配技术对语病感知的 ASR 有效且高效,同时暴露了多语言 E2E 系统的关键局限性。

关键词

引用

@article{arxiv.2512.02027,
  title  = {On the Difficulty of Token-Level Modeling of Dysfluency and Fluency Shaping Artifacts},
  author = {Kashaf Gulzar and Dominik Wagner and Sebastian P. Bayerl and Florian Hönig and Tobias Bocklet and Korbinian Riedhammer},
  journal= {arXiv preprint arXiv:2512.02027},
  year   = {2025}
}

备注

6 pages, 1 figure. Accepted to ASRU 2025. This is the arXiv preprint of the accepted paper