自动化的词汇稳定性与语言谱系
计算与语言
2009-12-07 v2 物理与社会
种群与进化
摘要
测量语言之间距离的想法似乎源于法国探险家 Dumont D'Urville 的工作 (D'Urville 1832)。他在 1826 年至 1829 年乘坐 Astrolabe 号航行期间收集了各种语言的比较词汇表,并在其关于太平洋地理划分的著作中,提出了一种测量语言之间关联程度的方法。由 Morris Swadesh 在 20 世纪 50 年代发展的现代语言年代学使用的方法 (Swadesh 1952),通过共享同源词(即具有共同历史起源的词汇)的百分比来测量距离。最近,我们提出了一种新的自动化方法,该方法使用相同含义词汇之间的归一化 Levenshtein 距离,并对列表中的词汇取平均。语言年代学中的另一个经典问题是研究对应不同含义的词汇的稳定性。实际上,词汇会因词汇变化、借用和替换而演变,其速率并非对所有词汇都相同。不同含义的词汇演变速度不同,这可能与相关词汇的使用频率有关 (Pagel et al. 2007)。本文仅基于归一化 Levenshtein 距离,通过一种自动化方法来解决这个问题。
引用
@article{arxiv.0911.3292,
title = {Automated words stability and languages phylogeny},
author = {Filippo Petroni and Maurizio Serva},
journal= {arXiv preprint arXiv:0911.3292},
year = {2009}
}
备注
XI International Conference "Cognitive Modeling in Linguistics-2009" Constanca, Romania, September, 7-14, 2009