我如何为语言濒危的语音识别系统构建面向口语词典的 ASR
计算与语言
2025-10-07 v1
摘要
全球近一半的语言濒危。语音技术,如自动语音识别(ASR),是语言复兴的关键措施,但大多数语言仍不受支持,因为标准管道期望 utterance 级别的监督数据。语音数据常存在于濒危语言中,但很少匹配这些格式。例如,Manx Gaelic (约 2,200 名说话者),自 1948 年起就有转录语音数据,却不受现代系统支持。在本文中,我们探讨了为濒危语言构建 ASR 所需的最小数据量及其形式。我们表明,短格式发音资源是可行的替代方案,40 分钟此类数据即可为 Manx 构建可用 ASR (<50% WER)。我们复制了该方法,将其应用于 Cornish (约 600 名说话者),另一语言濒危语言。结果表明,进入门槛在数量和形式方面的要求远低于此前所想,为语言社区带来了希望,他们无法负担被随意设定的要求。
引用
@article{arxiv.2510.04832,
title = {How I Built ASR for Endangered Languages with a Spoken Dictionary},
author = {Christopher Bartley and Anton Ragni},
journal= {arXiv preprint arXiv:2510.04832},
year = {2025}
}