中文

从稳定性到不一致性:LLMs道德偏好研究

计算机与社会 2025-04-10 v1 人工智能

摘要

随着大型语言模型(LLMs)日益融入我们的日常生活,理解其隐含偏见和道德倾向变得至关重要。为此,我们引入了基于道德基础理论(Moral Foundations Theory)的道德基础LLM数据集(MFD-LLM),该理论通过六个核心基础来概念化人类的道德。我们提出了一种新颖的评估方法,通过回答一系列现实世界的道德困境,来捕捉LLMs在完整范围内显露的道德偏好。我们的发现表明,领先的模型具有相当均匀的价值偏好,却表现出缺乏一致性。

关键词

引用

@article{arxiv.2504.06324,
  title  = {From Stability to Inconsistency: A Study of Moral Preferences in LLMs},
  author = {Monika Jotautaite and Mary Phuong and Chatrik Singh Mangat and Maria Angelica Martinez},
  journal= {arXiv preprint arXiv:2504.06324},
  year   = {2025}
}