中文

社区规模而非句法复杂度更能预测大型语言模型在新型 Wug 测试中的准确性

计算与语言 2026-04-02 v3

摘要

大型语言模型的语言能力是持续争议的议题。本研究通过考察模型在涉及新型单词的形态学泛化任务中的表现,贡献于这一讨论。采用多语言版 Wug 测试,对六个模型进行测试,涵盖四种语言(加泰罗西亚语、英语、希腊语和西班牙语),并与人类说话者进行比较。旨在确定模型准确率是否接近人类 competence,以及是否主要受句法复杂度或语言社区规模(影响可用训练数据的数量)主导。与前期研究一致,结果显示模型能够以类人水平准确率对形态学过程进行泛化。然而,准确率模式更 closely 地与社区规模和数据可得性相关,而非结构复杂度,从而细化了文献中的早期论断。在 particular,语言社区规模更大、数字化表征更强的语言(如西班牙语和英语)准确率高于资源较少的语言(如加泰罗西亚语和希腊语)。总体而言,本研究表明模型行为主要受语言资源丰富度主导,而非对句法复杂度的敏感性,这反映了一种仅在表面上类似人类语言能力的表现。

关键词

引用

@article{arxiv.2510.12463,
  title  = {Community size rather than grammatical complexity better predicts Large Language Model accuracy in a novel Wug Test},
  author = {Nikoleta Pantelidou and Evelina Leivada and Raquel Montero and Paolo Morosi},
  journal= {arXiv preprint arXiv:2510.12463},
  year   = {2026}
}