婴儿推理基准:为评估婴儿语言模型生成发展启发的推理任务
计算与语言
2026-03-17 v2 人工智能
摘要
传统语言模型推理能力的评估主要依赖成人中心的基准测试,这些测试预设了广泛的世界知识、复杂的指令遵循以及成熟的语用能力。这些假设与基于发展符合原则的输入(如儿童话语和早期童年叙事)训练的婴儿语言模型不符,遮蔽了在此类约束下哪些推理能力(如果有的话)会浮现。我们引入婴儿推理基准 (BabyReasoningBench),这是一套由 GPT-5.2 生成的、基于发展心理学经典范式的 19 个推理任务,涵盖心理理论、类比与关系推理、因果推断与干预选择,以及已知易受记忆和语用干扰的核心推理原语。我们发现,两个基于 GPT-2 的婴儿语言模型(分别在 1000 万和 1000 万儿童话语文本上预训练)表现整体较低但差异较大:规模提升显著改善了若干因果和物理推理任务,而信念归属和语用敏感任务仍然具有挑战性。婴儿推理基准为分析基于儿童式训练分布支持哪些推理能力提供了发展导向的视角,并用于检验关于此类能力如何浮现的机制性假设。
引用
@article{arxiv.2601.18933,
title = {BabyReasoningBench: Generating Developmentally-Inspired Reasoning Tasks for Evaluating Baby Language Models},
author = {Kaustubh D. Dhole},
journal= {arXiv preprint arXiv:2601.18933},
year = {2026}
}