探索大型语言模型在推断用户对话人格特征方面的能力
计算与语言
2025-01-14 v1
摘要
大型语言模型(LLM)正在展示出在各个领域广泛的人类化能力,包括心理评估。这项研究评估了 GPT-4o 和 GPT-4o mini 是否能够在零-shot 提示条件下推断 Big Five 人格特征并生成 Big Five Inventory-10(BFI-10)项目得分。我们的发现表明,采用中间步骤——在计算特征之前对 BFI-10 项目得分进行提示——可提高准确性并更贴近金标准。这一结构化方法凸显了在提高预测精度方面利用心理学框架的重要性。此外,基于抑郁症状存在程度的组间比较揭示了模型之间的差异。将受试者分为两个组:至少有一个抑郁症状组和无症状组。GPT-4o mini 在症状组中表现出对抑郁症状在如神经质量(Neuroticism)和尽责性(Conscientiousness)等特征方面的敏感性,而 GPT-4o 在跨组的细致解读方面表现出优势。这些发现凸显了 LLM 有效地分析真实世界心理数据的潜力,为人工智能与心理学交叉领域的研究提供了有价值的基础。
引用
@article{arxiv.2501.07532,
title = {Investigating Large Language Models in Inferring Personality Traits from User Conversations},
author = {Jianfeng Zhu and Ruoming Jin and Karin G. Coifman},
journal= {arXiv preprint arXiv:2501.07532},
year = {2025}
}
备注
13 pages, 5 figures