利用预训练表征改善濒危语言未转录语音的可及性
计算与语言
2021-09-15 v3 声音
音频与语音处理
摘要
像 wav2vec 2.0 这样的预训练语音表征是自动语音识别(ASR)的有力工具。然而,许多濒危语言缺乏足够的数据来预训练此类模型,或者是没有标准化书写系统的 predominantly oral vernaculars(主要口头方言),从而无法进行微调。按例检索的口语词检测(QbE-STD)提供了一种替代方案,通过定位口语查询词来迭代索引未转录的语音语料库。使用来自 7 种澳大利亚原住民语言和一种荷兰地区变体的数据(所有这些语言均处于濒危或易危状态),我们表明 QbE-STD 可以通过利用为 ASR 开发的表征(wav2vec 2.0:英语单语模型和 XLSR53 多语模型)得到改进。令人惊讶的是,英语模型在 4 个澳大利亚语言数据集上优于多语模型,这对如何最优地利用自监督语音表征用于 QbE-STD 提出了疑问。尽管如此,我们发现 wav2vec 2.0 表征(英语或 XLSR53)在我们的濒危语言数据集上相比最先进的方法带来了巨大改进(相对 56-86%)。
引用
@article{arxiv.2103.14583,
title = {Leveraging pre-trained representations to improve access to untranscribed speech from endangered languages},
author = {Nay San and Martijn Bartelds and Mitchell Browne and Lily Clifford and Fiona Gibson and John Mansfield and David Nash and Jane Simpson and Myfany Turpin and Maria Vollmer and Sasha Wilmoth and Dan Jurafsky},
journal= {arXiv preprint arXiv:2103.14583},
year = {2021}
}
备注
Accepted at ASRU 2021