中文

基于 Levenshtein 距离的印欧语系语言树

物理与社会 2009-11-13 v1 数据分析、统计与概率 种群与进化

摘要

语言的演化与单倍体生物的演化极为相似。这一相似性近来被利用来构建语言树。关键在于定义所有语言对之间的距离,类似于遗传距离。已有多种方法被提出用于定义这些距离,其中一种被用于语言年代学的方法通过共享“同源词”的百分比来计算距离。同源词是指推断具有共同历史起源的词汇,主观判断在识别过程中起着重要作用。在此,我们进一步深化与演化生物学的类比,通过考虑具有相同含义的词汇之间的重整化 Levenshtein 距离,并对 Swadesh 列表中的所有词汇进行平均,引入语言对之间的遗传距离。这显著降低了过程的主观性,并极大地提高了可重复性。我们将该方法应用于印欧语系,考察了 50 种不同语言及其各自 Swadesh 列表中的 200 个词汇。我们得到的树与已发表的树非常相似,但存在一些显著差异。

关键词

引用

@article{arxiv.0708.2971,
  title  = {Indo-European languages tree by Levenshtein distance},
  author = {Maurizio Serva and Filippo Petroni},
  journal= {arXiv preprint arXiv:0708.2971},
  year   = {2009}
}