中文

利用树空间采样斯瓦迪士核心词表以识别相似语言

应用统计 2024-05-13 v1 计算与语言

摘要

沟通在人类互动中扮演着至关重要的角色。研究语言是一项有价值的任务,并且随着定量比较语言学和词汇统计学等领域的发展,它最近已变得具有定量性质。就作者自身的母语而言,英语的祖先和拉丁字母是首要关注点。印欧语系树将许多现代语言追溯到原始印欧语这一根源。斯瓦迪士的同源词在形成这一历史视角方面发挥了重要作用,其中一些主要语支包括日耳曼语族、凯尔特语族、意大利语族和波罗的-斯拉夫语族。本文将对开放书籍进行数据分析,其中最简单的奇异空间是3-蜘蛛图——三条射线在0点粘合其端点的并集T3——它可以表示这些用于语言聚类的树空间。这些树是使用基于使用拉丁字母的语言样本之间距离的单一链接聚类方法构建的。每次取三种语言,确定其重心。一些初步结果发现了非粘性和粘性样本均值。如果均值表现出非粘性属性,那么一种语言可能与其他两种语言来自不同的祖先。如果均值被认为是粘性的,那么这些语言可能共享一个共同祖先,或者所有语言可能具有不同的祖先。

关键词

引用

@article{arxiv.2405.06549,
  title  = {Sampling the Swadesh List to Identify Similar Languages with Tree Spaces},
  author = {Garett Ordway and Vic Patrangenaru},
  journal= {arXiv preprint arXiv:2405.06549},
  year   = {2024}
}

备注

19 pages, 26 figures