突破转录瓶颈:为极低资源领域语言微调语音识别模型
计算与语言
2025-06-25 v1 声音
音频与语音处理
摘要
自动语音识别(ASR)已达到高资源语言的惊人准确率,但其在语言学田野调查中的实用性仍受限。田野调查情境下收集的录音呈现独特挑战,包括自然语音、环境噪声以及来自不完整记录语言的严格受限数据集。本文对两种微调后的多语言ASR模型(MMS和XLS-R)在五种类型上语料低资源语言上的性能进行基准测试,控制训练数据时长。我们的发现表明,当训练数据极其有限时,MMS最为适合;而当训练数据超过一小时后,XLS-R显示出与之相当的性能。我们提供语言学依据的分析,旨在为现场语言学家提供实用指南,突出可复现的ASR适应方法,以缓解语言文档中的转录瓶颈。
引用
@article{arxiv.2506.17459,
title = {Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages},
author = {Siyu Liang and Gina-Anne Levow},
journal= {arXiv preprint arXiv:2506.17459},
year = {2025}
}