中文

基于归一化莱文斯坦距离的语言谱系与几何结构

计算与语言 2011-07-21 v3 种群与进化

摘要

语言对之间的距离可从词汇差异中评估的观点似乎源于法国探险家迪蒙·迪尔维尔的工作。他在1826年至1829年乘坐星盘号航行期间收集了多种语言的比较词表,并在关于太平洋地理划分的著作中提出了一种衡量语言之间关联程度的方法。现代词汇统计学使用的方法由莫里斯·斯瓦德什于20世纪50年代发展,通过共享同源词(即具有共同历史起源的词汇)的百分比来测量距离。该方法的一个弱点是主观判断起着重要作用。最近,我们提出了一种新的自动化方法,其动机源于与遗传学的类比。新方法避免了任何主观性,且结果易于被其他学者复现。两个语言之间的距离通过考虑具有相同含义的词对之间的重归一化莱文斯坦距离,并对词表中的词汇取平均来定义。考虑词长的重归一化起着关键作用,没有它就无法得到有意义的结果。本文简要回顾了我们的自动化方法,并通过考虑马达加斯加方言群来加以说明。我们表明,该方法不仅揭示了它们之间的亲缘关系,还提供了关于马达加斯加定居方式的许多新信息。

关键词

引用

@article{arxiv.1104.4426,
  title  = {Phylogeny and geometry of languages from normalized Levenshtein distance},
  author = {Maurizio Serva},
  journal= {arXiv preprint arXiv:1104.4426},
  year   = {2011}
}

备注

Review paper