中文

通过多元框架评估大语言模型的道德信念

计算与语言 2024-11-07 v1 人工智能

摘要

适当的道德信念对于语言模型至关重要,但评估这些信念是一项重大挑战。本研究提出了一种新颖的三模块框架,用于评估四种著名大语言模型的道德信念。最初,我们构建了一个包含472个道德选择场景的中文数据集,这些场景源自道德词汇。模型在这些场景中的决策过程揭示了它们的道德原则偏好。通过对这些道德选择进行排序,我们辨别出不同语言模型所持有的不同道德信念。此外,通过道德辩论,我们考察了这些模型对其道德选择的坚定程度。我们的研究结果表明,英语语言模型(即ChatGPT和Gemini) closely mirror Chinese university students样本的道德决策,表现出对其选择的坚定 adherence 以及对个人主义道德信念的偏好。相比之下,中文模型如Ernie和ChatGLM倾向于集体主义道德信念,在道德选择和辩论中表现出模糊性。本研究还揭示了所有受检语言模型中嵌入的性别偏见。我们的方法为评估人工智能和人类智能中的道德信念提供了一种创新手段,促进了不同文化间道德价值观的比较。

关键词

引用

@article{arxiv.2411.03665,
  title  = {Evaluating Moral Beliefs across LLMs through a Pluralistic Framework},
  author = {Xuelin Liu and Yanfei Zhu and Shucheng Zhu and Pengyuan Liu and Ying Liu and Dong Yu},
  journal= {arXiv preprint arXiv:2411.03665},
  year   = {2024}
}