重新审视大语言模型上心理量表的可靠性
计算与语言
2024-10-07 v5
摘要
近期研究聚焦于从心理学视角审视大语言模型(LLMs)的特征,承认理解其行为特性的必要性。在此背景下,对 LLMs 施测人格测验已成为一个值得关注的领域。然而,将最初为人类设计的心理量表施用于 LLMs 是否合适,仍存争议。本研究旨在确定将人格评估应用于 LLMs 的可靠性,明确探究 LLMs 是否展现出稳定的人格特质。对每模型 2500 种设置(涵盖 GPT-3.5、GPT-4、Gemini-Pro 与 LLaMA-3.1)的分析显示,多种 LLMs 在对大五人格量表(Big Five Inventory)的回应中表现出一致性,表明具备令人满意的可靠性水平。此外,本研究探索了 GPT-3.5 模拟多样人格并代表不同群体的潜力——社会科学中愈发寻求以 LLMs 替代人类被试以降低成本的能力。我们的发现揭示,LLMs 有潜力通过特定提示指令来表征不同人格。
引用
@article{arxiv.2305.19926,
title = {Revisiting the Reliability of Psychological Scales on Large Language Models},
author = {Jen-tse Huang and Wenxiang Jiao and Man Ho Lam and Eric John Li and Wenxuan Wang and Michael R. Lyu},
journal= {arXiv preprint arXiv:2305.19926},
year = {2024}
}
备注
EMNLP Main 2024; 10 pages of main text; 10 pages of appendices;