基于莱文斯坦距离的自动语言谱系构建
计算与语言
2012-07-03 v7 种群与进化
定量方法
摘要
语言随时间演化,其过程与生物体类似,可能涉及复制、突变和灭绝。利用这种相似性,原则上可以构建显示语言之间亲缘程度的谱系树。现代词汇统计学(由Swadesh在20世纪50年代发展)使用的方法,是根据具有共同历史起源的词汇百分比来测量距离。该方法的弱点是主观判断起着重要作用。我们最近提出了一种避免主观性的自动化方法,其结果可由使用相同数据库的研究复现,且不需要特定的语言学知识。此外,该方法允许快速比较大量语言。我们将该方法应用于印欧语系和南岛语系,在两种情况下均考虑了50种不同的语言。生成的谱系树与先前研究的结果相似,但在少数语言和子群的位置上存在一些重要差异。我们认为这些差异为谱系树的结构以及语系内的系统发育关系带来了新的信息。
引用
@article{arxiv.0911.3280,
title = {Automated languages phylogeny from Levenshtein distance},
author = {Maurizio Serva},
journal= {arXiv preprint arXiv:0911.3280},
year = {2012}
}
备注
Ideas and results in this paper were presented at the International Conference: Visitas Internationais, Instituto de Estudos Avancados Transdisciplinares, (Belo Horizonte, 2009)