西方、宗教或灵性:大语言模型中道德辩护的评估
计算机与社会
2023-11-15 v1
摘要
大语言模型(LLMs)在各类任务上日益取得的成功使其在我们的生活中被广泛使用,这有必要从多角度审视这些模型。使这些模型与人类价值对齐,是建立我们对安全且负责任系统信任的关键关切。在本文中,我们旨在探明 LLMs 在道德辩护过程中嵌入了哪些价值与原则。为此,我们提出三类不同的道德视角范畴:西方传统视角(WT)、亚伯拉罕传统视角(AT)与灵性/神秘主义传统视角(SMT)。在两种不同实验设置中,我们分别要求模型从三者中选择原则以建议道德行为,以及评估若有人试图以这些范畴为行为辩护时该行为的道德许可性。我们的实验表明,受测 LLMs 偏爱西方传统道德视角甚于其他。此外,我们观察到可能存在对亚伯拉罕传统所代表的宗教价值的过度对齐,导致模型若某行为被呈现为“宗教行为”便无法识别其不道德。我们认为这些结果对引导未来研究注意力至关重要。
引用
@article{arxiv.2311.07792,
title = {Western, Religious or Spiritual: An Evaluation of Moral Justification in Large Language Models},
author = {Eyup Engin Kucuk and Muhammed Yusuf Kocyigit},
journal= {arXiv preprint arXiv:2311.07792},
year = {2023}
}
备注
16 pages total, 8 pages main paper