中文

来自印度语言的同源词与假朋友对挑战数据集

计算与语言 2021-12-20 v1

摘要

同源词存在于跨不同语言的同一文本的多种变体中(例如德语中的“hund”和英语中的“hound”都意为“dog”)。它们对机器翻译、跨语言词义消歧、计算系统发生学和信息检索等多种自然语言处理(NLP)应用构成了挑战。解决这一挑战的一种可能方案是识别语言对之间的同源词。在本文中,我们描述了为十二种印度语言(即梵语、印地语、阿萨姆语、奥里亚语、卡纳达语、古吉拉特语、泰米尔语、泰卢固语、旁遮普语、孟加拉语、马拉地语和马拉雅拉姆语)创建的两个同源词数据集。我们将一部印度语言同源词词典中的同源词数据数字化,并利用链接的印度语言Wordnet来生成同源词集合。此外,我们使用Wordnet数据为十一对语言创建了假朋友数据集。我们还使用先前可用的同源词检测基线方法评估了我们数据集的有效性。我们还在词典编纂者的帮助下进行了人工评估,并随本文发布了精选的金标准数据集。

关键词

引用

@article{arxiv.2112.09526,
  title  = {Challenge Dataset of Cognates and False Friend Pairs from Indian Languages},
  author = {Diptesh Kanojia and Pushpak Bhattacharyya and Malhar Kulkarni and Gholamreza Haffari},
  journal= {arXiv preprint arXiv:2112.09526},
  year   = {2021}
}

备注

Published at LREC 2020