中文

评估大语言模型的发展认知能力

人工智能 2026-05-12 v1

摘要

对话式 AI 正越来越多地围绕用户的偏好、历史、目标和知识进行个性化,但对于用户如何解释和采纳模型输出以构建和理解其现实的方式的考察则相对有限。我们借鉴罗伯特·凯根的建构性发展理论作为补充视角。现有的评估方法要么依赖无法扩展的专家访谈,要么依赖专有、冗长或侵入性的句子填空工具。为使这一视角适用于大语言模型评估,我们引入了发展句子填空测试(DSCT),这是一套 20 题的工具,用于从自助文本中引发发展信号。在此过程中,我们将得到的标签视为类似阶段结构的触发响应的特征化,而非验证的个人发展阶段。我们随后探讨了在三种触发响应情境下,大语言模型能否恢复这些信号:模拟人格、真实人类respondents以及默认模型生成的答案。在模拟人格情境下,顶尖的前沿模型能够以高准确率恢复模拟者本意的标签。在真实的人类 DSCT 响应上,人类和大语言模型之间的一致性属于公平水平,较强的“邻域内”一致性优于精确一致性。最后,在没有人格条件化的情况下回答 DSCT 提示时,模型的响应在不同模型家族之间表现出稳定的阶段差异,较大的、更新的模型倾向于生成更高评级的文本。这些结果表明,阶段条件化的信号在合成响应中比人类书写的 DSCT 文本更为清晰,而面向阶段感知对话式 AI 的核心约束不仅是分类器准确率,还在于从触发文本中获取发展信号。

关键词

引用

@article{arxiv.2605.08549,
  title  = {Evaluating Developmental Cognition Capabilities of LLMs},
  author = {Xiao Xiao and Hayoun Noh and Mar Gonzalez-Franco},
  journal= {arXiv preprint arXiv:2605.08549},
  year   = {2026}
}

备注

9 pages, 3 figures, (10 pages appendix)