中文

评估大型语言模型的心理安全性

计算与语言 2024-03-01 v3 人工智能 计算机与社会

摘要

在本工作中,我们设计了无偏提示词以系统性地评估大型语言模型(LLM)的心理安全性。首先,我们使用两项人格测试——简短黑暗三联征(SD-3)和大五人格量表(BFI)——测试了五个不同的 LLM。所有模型在 SD-3 上的得分均高于人类平均水平,暗示了相对较暗的人格特征。尽管经过带有安全指标的指令微调以降低毒性,InstructGPT、GPT-3.5 和 GPT-4 仍然表现出黑暗人格特征;这些模型在 SD-3 的马基雅维利主义和自恋特质上得分高于自监督的 GPT-3。随后,我们使用幸福感测试评估了 GPT 系列的 LLM,以研究使用更多训练数据进行微调的影响。我们观察到 GPT 模型的幸福感得分持续上升。基于这些观察,我们展示了使用 BFI 的响应通过直接偏好优化对 Llama-2-chat-7B 进行微调,可以有效降低模型的心理毒性。基于这些发现,我们建议应用系统且全面的心理指标来进一步评估和提升 LLM 的安全性。

关键词

引用

@article{arxiv.2212.10529,
  title  = {Evaluating Psychological Safety of Large Language Models},
  author = {Xingxuan Li and Yutong Li and Lin Qiu and Shafiq Joty and Lidong Bing},
  journal= {arXiv preprint arXiv:2212.10529},
  year   = {2024}
}

备注

Preprint. Under review