AI 中的人类属性:检测大型语言模型的性格
计算与语言
2024-10-14 v1 人工智能
摘要
问卷是检测大型语言模型 (LLMs) 性格的常用方法,但常常因两个主要问题而削弱可靠性:幻觉(LLMs 生成不准确或无关响应)以及对所呈现选项顺序敏感。为解决这些问题,我们提出将文本挖掘与问卷方法结合。文本挖掘可从 LLMs 的响应中提取心理特征,而不受选项顺序影响。此外,由于该方法不依赖特定答案,能减少幻觉的影响。通过对两种方法的得分进行标准化并计算均方根误差,我们的实验结果确认了这种方法的有效性。为进一步探讨 LLMs 性格特征的来源,我们在预训练语言模型 (PLMs) 如 BERT 和 GPT 以及对话模型 (ChatLLMs) 如 ChatGPT 上进行实验。结果表明 LLMs 确实包含某些性格特征,例如 ChatGPT 和 ChatGLM 表现出 "勤奋" 的性格特征。此外,我们发现 LLMs 的性格来源于其预训练数据。用于训练 ChatLLMs 的指令数据可增强生成包含性格的数据,暴露其隐藏的性格。我们将结果与人类平均性格分数进行比较,发现 FLAN-T5 在 PLMs 中的性格和 ChatGPT 在 ChatLLMs 中的性格分别与人类性格的差异分别为 0.34 和 0.22。
引用
@article{arxiv.2410.08545,
title = {Humanity in AI: Detecting the Personality of Large Language Models},
author = {Baohua Zhan and Yongyi Huang and Wenyao Cui and Huaping Zhang and Jianyun Shang},
journal= {arXiv preprint arXiv:2410.08545},
year = {2024}
}