基于 Levenshtein 距离的印欧语系语言树
物理与社会
2009-11-13 v1 数据分析、统计与概率
种群与进化
摘要
语言的演化与单倍体生物的演化极为相似。这一相似性近来被利用来构建语言树。关键在于定义所有语言对之间的距离,类似于遗传距离。已有多种方法被提出用于定义这些距离,其中一种被用于语言年代学的方法通过共享“同源词”的百分比来计算距离。同源词是指推断具有共同历史起源的词汇,主观判断在识别过程中起着重要作用。在此,我们进一步深化与演化生物学的类比,通过考虑具有相同含义的词汇之间的重整化 Levenshtein 距离,并对 Swadesh 列表中的所有词汇进行平均,引入语言对之间的遗传距离。这显著降低了过程的主观性,并极大地提高了可重复性。我们将该方法应用于印欧语系,考察了 50 种不同语言及其各自 Swadesh 列表中的 200 个词汇。我们得到的树与已发表的树非常相似,但存在一些显著差异。
引用
@article{arxiv.0708.2971,
title = {Indo-European languages tree by Levenshtein distance},
author = {Maurizio Serva and Filippo Petroni},
journal= {arXiv preprint arXiv:0708.2971},
year = {2009}
}