中文

容忍原则与小语言模型学习

计算与语言 2026-01-21 v1

摘要

像 GPT-3、BERT 和 LLaMA 这样的现代语言模型需要海量训练数据,然而在充分训练后,它们能可靠地学会区分合乎语法与不合语法的句子。年仅 14 个月大的儿童就已经有能力从极少的范例中学习抽象的语法规则,即使存在不遵循规则的例外情况。Yang (2016) 的容忍原则定义了一个精确的阈值,规定了一条规则可以容忍多少例外而仍然可被学习。本研究探索了基于 Transformer 的语言模型泛化规则所需的最小训练数据量和质量,以检验容忍原则的预测。我们在人工语法上训练了 BabyBERTa(Huebner 等人,2021),这是一个针对小数据集优化的 Transformer 模型。训练集在大小、独特句子类型数量以及遵循规则与例外范例的比例上有所不同。我们发现,与人类婴儿不同,BabyBERTa 的学习动态并不符合容忍原则。

关键词

引用

@article{arxiv.2601.12179,
  title  = {Tolerance Principle and Small Language Model Learning},
  author = {Adam E. Friedman and Stevan Harnad and Rushen Shi},
  journal= {arXiv preprint arXiv:2601.12179},
  year   = {2026}
}

备注

14 pages, 6 figures. BUCLD 50 Proceedings. To be published in 2026 by Cascadilla Press