从孤立语言到语言族:使用神经网络进行自动语言归属
计算与语言
2025-12-09 v1
摘要
在历史语言学中,语言归属传统上通过依赖手动比较单个语言的复杂工作流程来完成。大规模标准化的多语言词表和语法语言结构集合可能有助于改进这一过程,并为开发自动语言归属工作流程开辟新方向。本文介绍了神经网络模型,这些模型使用来自全球超过1000种已知归属语言的词汇和语法数据来对单个语言进行族系分类。与大多数语言学家的传统假设相符,我们的结果表明,仅基于词汇数据的模型在基于语法数据alone的模型方面表现更好,而将两者结合使用则能获得更好的性能。在额外的实验中,我们展示了这些模型如何识别整个子群的远程关系,如何用于探讨语言孤立体的潜在亲属关系,以及如何帮助我们获取对尚未归属语言的首次线索。我们得出结论,使用词汇和语法数据训练的自动语言归属模型为比较语言学家提供了一个有价值的工具,用于评估关于深层和未知语言关系的假设。
引用
@article{arxiv.2502.11688,
title = {From Isolates to Families: Using Neural Networks for Automated Language Affiliation},
author = {Frederic Blum and Steffen Herbold and Johann-Mattis List},
journal= {arXiv preprint arXiv:2502.11688},
year = {2025}
}
备注
Submitted to the 63rd Annual Meeting of the Association for Computational Linguistics, Vienna, Austria