AI 心理计量学: 基于心理测量效度评估大型语言模型的心理推理
人工智能
2026-03-16 v1
摘要
大型语言模型(LLM)拥有庞大的参数数量和深层神经网络,使其与人脑的复杂度相媳美,这也使得它们成为难以评估和解释的“黑盒”系统。AI 心理计量学是一门旨在通过应用心理计量方法来评估和解释人工智能(AI)系统心理特征和过程的新兴领域。本文探讨了将 AI 心理计量学应用于评估四个主要大型语言模型(GPT-3.5、GPT-4、LLaMA-2 和 LLaMA-3)的心理推理和整体心理计量效度。我们采用技术接受模型(TAM),检验这些模型在收敛性、判别性、预测性和外部效度方面的表现。我们的发现表明,这四个模型的响应通常满足所有效度标准。更进一步,像 GPT-4 和 LLaMA-3 这类表现更好的模型在心理计量效度上始终优于它们的前代 GPT-3.5 和 LLaMA-2。这些结果有助于确立将 AI 心理计量学应用于评估和解释大型语言模型的有效性。
引用
@article{arxiv.2603.11279,
title = {AI Psychometrics: Evaluating the Psychological Reasoning of Large Language Models with Psychometric Validities},
author = {Yibai Li and Xiaolin Lin and Zhenghui Sha and Zhiye Jin and Xiaobing Li},
journal= {arXiv preprint arXiv:2603.11279},
year = {2026}
}
备注
Accepted for publication in the Proceedings of the 58th Hawaii International Conference on System Sciences (HICSS), 2025