基于大语言模型的心理测量量表体内开发:代表性人群数据模拟的可行性
人机交互
2025-12-30 v2 人工智能
摘要
开发和验证心理测量量表需要大样本、多个测试阶段和大量资源。近期大语言模型(LLMs)的进展使能够通过让模型在特定人口统计特征的模拟下作答来生成合成参与者数据, potentially 实现体内 piloting, 在实际数据收集之前进行测试。我们在四个预先登记的研究中(每个约300个样本)测试了LLM模拟数据集是否能够复现人类响应的潜在结构和测量属性。在研究1-2中,我们将LLM生成的数据与真实数据集进行比较;在研究3-4中,我们使用模拟数据进行因素分析(EFA)创建新的量表,然后检验这些结构是否能推广到新收集的人类样本。模拟数据集在四个研究中的三个研究中复制了预期的因子结构,并表现出一致的配置不变性和度量不变性,对于两个新开发的量表实现了标量不变性。然而,相关性检验揭示了真实与合成数据集之间存在显著差异,评分分布和方差也存在显著差异。因此,尽管LLMs在捕捉群体水平的潜在结构方面具有作用,但它们并不逼近个体水平的数据属性。模拟数据集在性别上显示出完整的内部不变性。总体而言,LLM生成的数据对于早期阶段的群体水平心理测量原型设计似乎有用,但不能作为个体水平验证的替代品。我们讨论了方法论局限性、偏见和数据污染的风险,以及与体内心理测量模拟相关的伦理考虑。
引用
@article{arxiv.2512.02910,
title = {In Silico Development of Psychometric Scales: Feasibility of Representative Population Data Simulation with LLMs},
author = {Enrico Cipriani and Pavel Okopnyi and Danilo Menicucci and Simone Grassini},
journal= {arXiv preprint arXiv:2512.02910},
year = {2025}
}