中文

处理以拉丁字母书写的南亚语言:Dakshina 数据集

计算与语言 2020-07-03 v1

摘要

本文描述了 Dakshina 数据集,这是一个由 12 种南亚语言的拉丁字母与原生文字文本组成的新资源。该数据集对每种语言包含:1)原生文字维基百科文本;2)罗马化词典;3)该语言原生文字与基础拉丁字母之间的完整句子平行数据。我们记录了每种语言中维基百科文本的准备工作与筛选方法;对抽样词典中已证实罗马化的收集;以及对原生文字集合中留出句子的人工罗马化。我们还基于该数据集在若干任务上提供了基线结果,包括单词音译、完整句子音译,以及原生文字与罗马化文本的语言建模。关键词:罗马化,音译,南亚语言

关键词

引用

@article{arxiv.2007.01176,
  title  = {Processing South Asian Languages Written in the Latin Script: the Dakshina Dataset},
  author = {Brian Roark and Lawrence Wolf-Sonkin and Christo Kirov and Sabrina J. Mielke and Cibu Johny and Isin Demirsahin and Keith Hall},
  journal= {arXiv preprint arXiv:2007.01176},
  year   = {2020}
}

备注

Published at LREC 2020