LLM能否评估人格?对对话式AI人格轮廓的验证性研究
计算与语言
2026-02-19 v1 人工智能
摘要
本研究验证了大语言模型(LLM)作为问卷式人格评估的动态替代方案。我们进行了一项以个体为单位的实验(N=33),将引导式LLM对话得到的Big Five人格分数与金标准IPIP-50问卷进行比较,同时测量用户对准确性的感知。结果表明,收敛效度呈中等程度(),其中Conscientiousness(尽责性)、Openness(开放性)和Neuroticism(神经质)在两种方法之间统计上等价。然而,Agreeableness(宜人性)和Extraversion(外向性)显示出显著差异,表明需要针对特定特质进行校准。值得注意的是,参与者将LLM生成的轮廓评定为与传统问卷结果相当的准确性。这一发现表明,对话式AI为传统心理学测量提供了有前景的新方法。
引用
@article{arxiv.2602.15848,
title = {Can LLMs Assess Personality? Validating Conversational AI for Trait Profiling},
author = {Andrius Matšenas and Anet Lello and Tõnis Lees and Hans Peep and Kim Lilii Tamm},
journal= {arXiv preprint arXiv:2602.15848},
year = {2026}
}
备注
13 pages, 7 figures, 4 tables, 2 appendices