中文

面向印尼语的顿停感知自动语音识别

计算与语言 2026-01-15 v2

摘要

自动语音识别系统在流畅语音上取得了显著的性能,但在处理顿停语音时仍会显著下降,这在低资源语言如印尼语的情况下尤为突出,因为此类语言几乎不存在专业数据集。为克服这一稀缺性,我们提出一种数据增强框架,通过规则转换和大语言模型生成合成顿停音频,再通过语音合成技术实现。我们将该合成数据用于迁移学习微调预训练的印尼语Whisper模型,使其能够在不需大规模真实录音的情况下适应顿停声学模式。我们的实验表明,这种针对性的合成数据暴露在顿停语音上能持续减少识别错误,同时保持流畅片段的性能,验证了合成数据管道在开发 underrepresented 语言更包容性语音技术方面的实用性。

关键词

引用

@article{arxiv.2601.03727,
  title  = {Stuttering-Aware Automatic Speech Recognition for Indonesian Language},
  author = {Fadhil Muhammad and Alwin Djuliansah and Adrian Aryaputra Hamzah and Kurniawati Azizah},
  journal= {arXiv preprint arXiv:2601.03727},
  year   = {2026}
}

备注

Preprint