中文

突破转录瓶颈:为极低资源领域语言微调语音识别模型

计算与语言 2025-06-25 v1 声音 音频与语音处理

摘要

自动语音识别(ASR)已达到高资源语言的惊人准确率,但其在语言学田野调查中的实用性仍受限。田野调查情境下收集的录音呈现独特挑战,包括自然语音、环境噪声以及来自不完整记录语言的严格受限数据集。本文对两种微调后的多语言ASR模型(MMS和XLS-R)在五种类型上语料低资源语言上的性能进行基准测试,控制训练数据时长。我们的发现表明,当训练数据极其有限时,MMS最为适合;而当训练数据超过一小时后,XLS-R显示出与之相当的性能。我们提供语言学依据的分析,旨在为现场语言学家提供实用指南,突出可复现的ASR适应方法,以缓解语言文档中的转录瓶颈。

关键词

引用

@article{arxiv.2506.17459,
  title  = {Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages},
  author = {Siyu Liang and Gina-Anne Levow},
  journal= {arXiv preprint arXiv:2506.17459},
  year   = {2025}
}