中文

使用 Wikipedia Glottosets 对 242 种语言进行基于子词的比较语言学研究

计算与语言 2026-01-27 v1 人工智能 机器学习

摘要

我们使用基于子词的方法,对 242 种拉丁字母和西里尔字母语言进行了大规模比较研究。通过从 Wikipedia 词典构建“glottosets”,我们引入了一个通过 Byte-Pair Encoding (BPE) 进行同步跨语言比较的框架。我们的方法利用基于排序的子词向量,大规模分析词汇重叠、词汇分歧和语言相似性。评估表明,在 15 种语言中,BPE 分割与语素边界的对齐比随机基线好 95%(F1 = 0.34 vs 0.15)。BPE 词汇相似性与语言发生学亲缘关系显著相关(Mantel r = 0.329, p < 0.001),其中罗曼语族形成最紧密的聚类(平均距离 0.51),而跨语系对显示出明显的分离(0.82)。对 26,939 个跨语言同形词的分析表明,48.7% 在相关语言中接受了不同的分割,其变异与系统发生距离相关。我们的结果在一个统一的分析框架内,为类型多样的语言间的词汇模式提供了定量的宏观语言学见解。

关键词

引用

@article{arxiv.2601.18791,
  title  = {Subword-Based Comparative Linguistics across 242 Languages Using Wikipedia Glottosets},
  author = {Iaroslav Chelombitko and Mika Hämäläinen and Aleksey Komissarov},
  journal= {arXiv preprint arXiv:2601.18791},
  year   = {2026}
}

备注

15 pages, 4 figues, 4 tables