中文

南岛语系语言识别

计算与语言 2022-06-10 v1

摘要

本文为太平洋地区低资源与资源不足的语言提供语言识别模型,重点关注此前不可用的南岛语系语言。准确的语言识别是开发语言资源的重要部分。本文所采取的方法将 29 种南岛语系语言与 171 种非南岛语系语言结合,从八个数据源构建评测集。在评估六种语言识别方法后,我们发现基于 skip-gram 嵌入的分类器达到了显著高于其他方法的性能。随后我们系统性地增加模型中非南岛语系语言的数量至总计 800 种,以评估语言库存的增加是否会降低对所关注南岛语系语言预测的精确度。该评测发现,增加非南岛语系语言库存对准确率的影响极小。进一步的实验将这些语言识别模型适配于语码转换检测,在所有 29 种语言上均取得高准确率。

关键词

引用

@article{arxiv.2206.04327,
  title  = {Language Identification for Austronesian Languages},
  author = {Jonathan Dunn and Wikke Nijhof},
  journal= {arXiv preprint arXiv:2206.04327},
  year   = {2022}
}