大语言模型心理测量:评估、验证与提升的系统综述
计算与语言
2026-03-12 v3 人工智能
人机交互
摘要
大语言模型(LLMs)的发展速度已超过传统评估方法。这一进步带来了新挑战,如测量类人心理构造、超越静态且特定于任务的基准测试,以及建立以人类为中心的评估。这些挑战与心理测量学交汇——即量化人类心理中不可直接衡量方面的科学,如人格、价值观和智力。本综述论文引入并综合了新兴的跨学科领域——LLM心理测量学(LLM Psychometrics),该领域利用心理测量工具、理论和原则来评估、理解和提升大语言模型。所综述的文献系统性地塑造了基准测试原则,拓宽了评估范围,细化了方法,验证了结果,并推动了LLM能力的发展。整合了不同视角,为跨学科研究者提供结构化框架,使其能够更全面地理解这一新兴领域。最终,综述提供了可行见解,用于开发与人类水平AI相匹配的未来评估范式,促进面向社会福祉的人类中心AI系统的发展。一个精选的LLM心理测量资源库可在https://github.com/valuebyte-ai/Awesome-LLM-Psychometrics上访问。
引用
@article{arxiv.2505.08245,
title = {Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement},
author = {Haoran Ye and Jing Jin and Yuhang Xie and Xin Zhang and Guojie Song},
journal= {arXiv preprint arXiv:2505.08245},
year = {2026}
}
备注
400+ references