Jambu:一个面向南亚语言的历史语言学数据库
计算与语言
2023-06-06 v1
摘要
我们介绍了Jambu,一个南亚语言同源词数据库,它以结构化且易于访问的格式统一了数十个先前的数据源。该数据库包含来自602种语言的287k个词目,归并为23k组同源词集。我们概述了编译该数据集所需的数据整理工作,并在该数据的印度-雅利安语子集上训练了用于形式对应预测的神经网络模型。我们希望Jambu对所有历史语言学家和印度学家都是宝贵的资源,并期待数据库的进一步改进与扩展。
引用
@article{arxiv.2306.02514,
title = {Jambu: A historical linguistic database for South Asian languages},
author = {Aryaman Arora and Adam Farris and Samopriya Basu and Suresh Kolichala},
journal= {arXiv preprint arXiv:2306.02514},
year = {2023}
}
备注
5 pages main text, 10 pages total. To appear at SIGMORPHON