中文

可读性 ≠ 可学习性:重新思考小型语言模型训练中简单性的作用

计算与语言 2025-10-17 v1 人工智能 机器学习

摘要

最近的研究表明,极小型语言模型(SLMs)在训练于简化的、面向儿童的语料库(如 TinyStories)时,能够生成惊人的连贯文本。人们将此解释为可读性——即可接近词汇、熟悉的叙事结构和简单语法——在使此类能力浮现中发挥关键作用。在本论文中,我们对此进行了挑战。我们构建了结构相同但可读性不同的合成数据集,发现可读性本身不足以预测连贯性或学习效率。模型在复杂的成人水平文本上训练的表现与在简化语言上训练的相当,甚至在训练期间展现出更快的连贯性发展。相反,我们表明,统计简单性(如 n-gram 多样性)是更强的可学习性预测器。我们的发现警示着日益增长的将语言模型训练拟人化的趋势——即在没有经验依据的前提下将其类比于人类认知发展——并主张对实际支持小模型能力浮现的属性进行更精确的推理。

关键词

引用

@article{arxiv.2510.13915,
  title  = {Readability $\ne$ Learnability: Rethinking the Role of Simplicity in Training Small Language Models},
  author = {Ivan Lee and Taylor Berg-Kirkpatrick},
  journal= {arXiv preprint arXiv:2510.13915},
  year   = {2025}
}

备注

Accepted to COLM 2025 (Spotlight)