中文

大语言模型自我评估的仿真:一种心理测量方法探讨 AI 自我效能

人工智能 2025-11-27 v2

摘要

自我评估是可靠智能的关键方面,但目前对大语言模型(LLM)的评估主要聚焦于任务准确率。我们将 10 项通用自我效能量表(GSES)改编为从十个 LLM 中提取仿真自我评估,涵盖四种情境:无任务、计算推理、社会推理和摘要生成。GSES 响应在多次给定和随机化选项顺序后表现出高度稳定性。然而,模型在不同情境下的自我效能水平存在显著差异,综合得分低于人类标准。所有模型在计算和社会问题上均实现了完美准确率,而摘要性能差异较大。自我评估并未可靠地反映模型能力:一些得分较低的模型表现准确,而一些得分较高的模型则生成较弱的摘要。后续置信度提示结果显示,虽然整体上呈现温和的向下修正趋势,但主要是对首次评估的轻微高估,表明模型可能存在一定程度的自我膨胀。定性分析表明,较高的自我效能得分对应更具断言性和拟人化的推理风格,而较低得分则表现出更谨慎和去拟人化的解释方式。心理测量式提示为理解 LLM 的交流行为提供了结构化视角,但并非校准的性能估计。

关键词

引用

@article{arxiv.2511.19872,
  title  = {Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy},
  author = {Daniel I Jackson and Emma L Jensen and Syed-Amad Hussain and Emre Sezgin},
  journal= {arXiv preprint arXiv:2511.19872},
  year   = {2025}
}

备注

25 pages,5 tables, 3 figures