中文

通过跨语言迁移和无监督聚类实现低资源班图语的零样态形态学发现

机器学习 2026-04-27 v1 计算与语言

摘要

我们提出了一种方法,通过结合跨语言迁移学习和无监督聚类来发现低资源班图语中的形态特征。该方法应用于吉里亚马语(nyf),该语仅有 91 个标记化范畴。我们的管道为 2,455 个单词发现名词类别分配,并识别了两个尚未记录的形态模式:Class 2 的 a 前缀变体(元音合并——两个相邻元音的合并——wa- 的 95.1% 一致性)以及缩写的 k' 前缀(98.5% 一致性)。外部验证在 444 个已知的吉里亚马语动词范畴上确认了 78.2% 的词形还原准确率,而 v3 语料库扩展至 19,624 个单词(9,014 个唯一词根)实现了 97.3% 的分段和 86.7% 的词形还原率,覆盖所有主要词类。我们的跨语言迁移和无监督聚类的集成方法通过加权投票利用了两者的互补优势:迁移在认同词检测方面表现突出(利用约 60% 的词汇重叠),而聚类发现迁移无法看到的语言特定创新。我们发布了所有代码和发现的词典,以支持低资源班图语的形态学记录。

关键词

引用

@article{arxiv.2604.22723,
  title  = {Zero-Shot Morphological Discovery in Low-Resource Bantu Languages via Cross-Lingual Transfer and Unsupervised Clustering},
  author = {Hillary Mutisya and John Mugane},
  journal= {arXiv preprint arXiv:2604.22723},
  year   = {2026}
}