中文

从现代数据中恢复历史波拉文结构的神经网络方法

机器学习 2026-04-27 v1 计算与语言

摘要

我们研究是否能通过仅在现代形态学数据上训练的神经模型来恢复与历史重构一致的跨语言词汇结构。我们使用针对波拉文形态学范式的 Transformer BantuMorph v7,分析 14 种东部和南部波拉文语言,提取其名词和动词 lemma 的编码器嵌入,并识别出在 5+ 语言中共享的 728 个名词和 1,525 个动词 cognate 候选对象。我们将这些候选对象与既定历史资源——波拉文词汇重构数据库 (BLR3;4,786 个已重构的原始波拉文形式) 和 ASJP 基础词汇表——进行评估,我们确认 10 个最高 11 个名词候选对象 (90.9%) 与之前重构的原始波拉文形式一致,包括 *-ntU 'person' (8 种语言),*gombe 'cow' (9 种语言),以及 *mUn (9 种语言)。扩展到动词,12 个动词 cognate 与重构的原始波拉文根词吻合,包括 *-bon- 'see' 和 *-jIm- 'stand',每个词在广泛地理范围内都有记录。使用独立翻译模型 (NLLB-600M) 进行跨模型验证确认了这些模式:两个模型都恢复了 cognate 簇和与既定 Guthrie 区域分类一致的系谱分组 (p < 0.01)。跨语言名词类分析显示,所有 13 个有生产性的名词类在语言间保持 >0.83 的余弦相似度 (同一名词类内部 > 不同名词类之间,p < 10^-9)。我们的数据集局限于东部和南部波拉文,因此我们将这些结果解释为恢复与原始波拉文一致的共享波拉文词汇结构,而非明确区分原始波拉文保留与后来地区性创新。

关键词

引用

@article{arxiv.2604.22730,
  title  = {Neural Recovery of Historical Lexical Structure in Bantu Languages from Modern Data},
  author = {Hillary Mutisya and John Mugane},
  journal= {arXiv preprint arXiv:2604.22730},
  year   = {2026}
}