将心理测量学应用于大语言模型模拟群体:使用生成式智能体重现HEXACO人格量表实验
计算与语言
2025-09-23 v2 机器学习
摘要
由大型语言模型驱动的生成式智能体通过复杂的自然语言交互展现出类似人类的特征。它们基于预定义角色传记扮演角色和人格的能力,使其成为社会科学研究中人类参与者的经济高效替代品。本文探讨了此类基于角色的智能体在代表人类群体方面的有效性;我们通过调查310个GPT-4驱动的智能体,对其回答进行因子分析,并将这些结果与Ashton、Lee和Goldberg在2004年提出的原始发现进行比较,重现了HEXACO人格量表实验。我们的结果发现:1)从智能体的回答中可以恢复出一个连贯且可靠的人格结构,该结构与HEXACO框架部分对齐;2)当与充分筛选的群体结合时,GPT-4中得出的人格维度是一致且可靠的;3)跨模型分析揭示了人格画像的变异性,表明存在特定模型的偏差和局限性。我们讨论了实验中遇到的实际考量和挑战。本研究为关于在社会科学研究中使用生成式智能体的潜在益处和局限性的持续讨论做出了贡献,并为设计一致且具有代表性的智能体角色以最大化人类人格特质的覆盖面和代表性提供了有用的指导。
引用
@article{arxiv.2508.00742,
title = {Applying Psychometrics to Large Language Model Simulated Populations: Recreating the HEXACO Personality Inventory Experiment with Generative Agents},
author = {Sarah Mercer and Daniel P. Martin and Phil Swatton},
journal= {arXiv preprint arXiv:2508.00742},
year = {2025}
}