中文

"拉不拉?":探究主导大型语言模型在伦理困境中的道德偏见

计算与语言 2025-08-12 v1 人工智能 计算机与社会

摘要

随着大型语言模型(LLM)日益介入伦理敏感决策,理解其道德推理过程变得至关重要。本研究对14个领先LLM(包括推理型和通用型)进行全面实证评估,基于27个多样化的伦理困境情景(如trolley problem),涵盖utilitarianism、deontology、altruism等十种道德哲学。我们采用阶梯式提示协议,从而召集3780个二元决策与自然语言论证,实现沿决策果断性、解释一致性、公共道德一致性以及对伦理无关线索敏感性等维度的分析。我们的发现揭示,不同伦理框架和模型类型之间存在显著差异:具备推理能力的模型表现出更果断的决策与更结构化的论证,然而并不总是与人类共识更一致。值得注意的是,在altruistic、公平和virtue ethics等框架中,存在"甜蜜区",即模型在高干预率、低解释冲突和最小化对聚合人类判断偏离方面取得平衡。然而,在强调亲属关系、合法性或自我利益的框架下,模型却表现出分歧,常产生争议性的伦理结果。这些模式表明,道德提示不仅是行为调制剂,更是揭示各提供方潜在对齐哲学的诊断工具。我们主张将道德推理作为LLM对齐的主要轴向,呼吁制定标准化基准,评估不仅是LLM做出何种决定,而是如何以及为何做出决定。

关键词

引用

@article{arxiv.2508.07284,
  title  = {"Pull or Not to Pull?'': Investigating Moral Biases in Leading Large Language Models Across Ethical Dilemmas},
  author = {Junchen Ding and Penghao Jiang and Zihao Xu and Ziqi Ding and Yichen Zhu and Jiaojiao Jiang and Yuekang Li},
  journal= {arXiv preprint arXiv:2508.07284},
  year   = {2025}
}