中文

Jambu:一个面向南亚语言的历史语言学数据库

计算与语言 2023-06-06 v1

摘要

我们介绍了Jambu,一个南亚语言同源词数据库,它以结构化且易于访问的格式统一了数十个先前的数据源。该数据库包含来自602种语言的287k个词目,归并为23k组同源词集。我们概述了编译该数据集所需的数据整理工作,并在该数据的印度-雅利安语子集上训练了用于形式对应预测的神经网络模型。我们希望Jambu对所有历史语言学家和印度学家都是宝贵的资源,并期待数据库的进一步改进与扩展。

关键词

引用

@article{arxiv.2306.02514,
  title  = {Jambu: A historical linguistic database for South Asian languages},
  author = {Aryaman Arora and Adam Farris and Samopriya Basu and Suresh Kolichala},
  journal= {arXiv preprint arXiv:2306.02514},
  year   = {2023}
}

备注

5 pages main text, 10 pages total. To appear at SIGMORPHON