通过自动语音识别技术支持 SENCOTEN 语言的文档工作
声音
2025-07-22 v2 计算与语言
音频与语音处理
摘要
SENCOTEN 语言是位于温哥华岛南部桑奇半岛的语言,正处于积极的语言复兴运动中,以应对殖民语言政策导致的语言丧失。为支持这些现场的努力,社区正在寻求数字技术。自动语音识别 (ASR) 技术对加快语言文档和教育资源的创建具有巨大的潜力。然而,由于数据有限以及该语言多音节结构和应力导向的互换导致的词汇变异较大,开发 SENCOTEN 语言的 ASR 系统具有挑战。为解决这些挑战,我们提出了一个利用文本转语音 (TTS) 系统增强语音数据和跨语言迁移学习的 ASR 驱动文档管道。还通过浅层融合或 n-best 恢复方式融入 n-gram 语言模型,以最大化可用数据的利用。在 SENCOTEN 数据集上的实验显示,测试集上的词错误率 (WER) 为 19.34%,字符错误率 (CER) 为 5.09%,且未在词表中的词汇 (OOV) 率为 57.02%。在过滤次要的变形符号相关错误后,WER 提升至 14.32%(未见词上的 26.48%),CER 降至 3.45%,表明我们的 ASR 驱动管道为支持 SENCOTEN 语言文档具有潜力。
引用
@article{arxiv.2507.10827,
title = {Supporting SENCOTEN Language Documentation Efforts with Automatic Speech Recognition},
author = {Mengzhe Geng and Patrick Littell and Aidan Pine and PENÁĆ and Marc Tessier and Roland Kuhn},
journal= {arXiv preprint arXiv:2507.10827},
year = {2025}
}
备注
Accepted by ComputEL-8