衡量 LLM 内化人类心理概念的能力:初步分析
机器学习
2025-07-01 v1 人工智能
摘要
大型语言模型(LLM)如 ChatGPT 在生成类人文本方面展现出惊人的能力。然而,这些模型是否准确内化了塑造人类思维和行为的概念尚不清楚。本文发展了一个定量框架,用于评估 LLM 与人类心理维度之间的概念对齐度,采用 43 个标准化心理问卷进行评估,这些问卷被选取用于衡量离散心理构建块。我们的方法评估语言模型通过成对相似性分析重构和分类问卷项目的准确性。我们将得到的聚类结构与原始分类标签进行层次聚类比较。GPT-4 模型实现了优越的分类准确率(66.2%),显著优于 GPT-3.5(55.9%)和 BERT(48.1%),所有模型都超过随机基线性能(31.9%)。我们还演示了从 GPT-4 估计的语义相似性与多个心理问卷中人类响应的皮尔逊相关系数相关。该框架提供了一种新方法,用于评估人类-LLM 概念的对齐情况并识别潜在的表征偏见。我们的发现表明,现代 LLM 能够以可衡量的准确性近似人类心理构建块,为开发更具可解释性的 AI 系统提供了见解。
引用
@article{arxiv.2506.23055,
title = {Measuring How LLMs Internalize Human Psychological Concepts: A preliminary analysis},
author = {Hiro Taiyo Hamada and Ippei Fujisawa and Genji Kawakita and Yuki Yamada},
journal= {arXiv preprint arXiv:2506.23055},
year = {2025}
}