中文

无需过度假设归纳的范例检索:分布序列学习在早期词汇学习中的局限

计算与语言 2026-04-08 v1 人工智能

摘要

背景:儿童不仅仅是学习球是圆的、积木是方的。他们学习形状是定义物体类别的特征类型——一种称为过度假设的二阶泛化 [1, 2]。什么样的学习机制足以实现这种归纳跃迁?方法:我们在合成语料库上训练了自回归 Transformer 语言模型(3.4M–25.6M 参数),其中形状是跨类别的稳定特征维度,包含八个控制替代解释的条件。结果:在 120 个预注册运行中,通过 1040 项的 wug 测试电池评估,每个模型都实现了完美的一阶范例检索(100%),而对新颖名词的二阶泛化仍保持在随机水平(50–52%),这一结果通过等价性检验得到确认。特征交换诊断揭示模型依赖框架到特征的模板匹配,而非结构化的名词到领域到特征的抽象。结论:这些结果揭示了分布序列学习在发育规模训练条件下的明确局限。

关键词

引用

@article{arxiv.2604.05243,
  title  = {Exemplar Retrieval Without Overhypothesis Induction: Limits of Distributional Sequence Learning in Early Word Learning},
  author = {Jon-Paul Cacioli},
  journal= {arXiv preprint arXiv:2604.05243},
  year   = {2026}
}

备注

27 pages, 7 figures, 22 references. Pre-registered study (OSF: https://osf.io/qj9hb/). Code and data: https://github.com/synthiumjp/overhypothesis. Submitted to Cognitive Computation