中文

通过音素表示的微调实现音素识别:以卢希亚语变体为例的研究

计算与语言 2021-04-06 v1

摘要

在多语言上预训练的模型已显示出改善语音识别的显著前景,特别是对于低资源语言。在本工作中,我们专注于使用 Allosaurus 进行音素识别,这是一种基于音素标注的多语言识别方法,它通过一个依赖于语言的音位变体层将通用窄音素集与每种语言中出现的音素相关联,从而融入音系学知识。为了在具有挑战性的真实场景中进行评估,我们为 Bukusu 和 Saamia 整理了音素识别数据集,这两种语言是肯尼亚西部和乌干达东部的卢希亚语族的变体。据我们所知,这些数据集是同类中的首个。我们还在一种濒危的 Tangkhulic 语言 East Tusom(主要分布于印度的藏缅语变体)的数据集上进行了类似实验。我们通过使用不同规模(10 到 1000 条语音)的数据集进行微调,探索了零样本和少样本识别。我们发现,即使仅使用 100 条语音对 Allosaurus 进行微调,也能显著降低音素错误率。

关键词

引用

@article{arxiv.2104.01624,
  title  = {Phoneme Recognition through Fine Tuning of Phonetic Representations: a Case Study on Luhya Language Varieties},
  author = {Kathleen Siminyu and Xinjian Li and Antonios Anastasopoulos and David Mortensen and Michael R. Marlo and Graham Neubig},
  journal= {arXiv preprint arXiv:2104.01624},
  year   = {2021}
}