中文

康格里低资源语言的单语与平行语料库

计算与语言 2021-03-23 v1

摘要

在本文中,我们呈现联合国教育、科学及文化组织(UNESCO)所列的喜马偕尔低资源濒危语言康格里语(Kangri,ISO 639-3 xnr)的数据集。由于数字化资源不可用,康格里语料库的编纂一直是一项挑战性任务。该语料库包含1,81,552条单语与27,362条印地语-康格里语平行语料。我们分享了预训练的康格里词语嵌入。我们还报告了统计机器翻译(SMT)与神经机器翻译(NMT)结果在该语料库上的双语评估替补(BLEU)分数与显式排序翻译评估度量(METEOR)分数。该语料库可免费用于非商业用途与研究。据我们所知,这是首个喜马偕尔低资源濒危语言语料库。相关资源可在 (https://github.com/chauhanshweta/Kangri_corpus) 获取。

关键词

引用

@article{arxiv.2103.11596,
  title  = {Monolingual and Parallel Corpora for Kangri Low Resource Language},
  author = {Shweta Chauhan and Shefali Saxena and Philemon Daniel},
  journal= {arXiv preprint arXiv:2103.11596},
  year   = {2021}
}

备注

7 pages, 6 Tables, 1 Figure