大语言模型的道德基础
人工智能
2023-10-25 v1 计算与语言
计算机与社会
摘要
道德基础理论(MFT)是一种心理学评估工具,将人类道德推理分解为五个因素,包括关怀/伤害、自由/压迫和圣洁/堕落(Graham et al., 2009)。人们在做出道德决策时对这些维度赋予的权重各异,部分源于其文化教养与政治意识形态。由于大语言模型(LLMs)是在从互联网收集的数据集上训练的,它们可能反映此类语料中存在的偏见。本文以MFT为透镜,分析流行LLMs是否习得了朝向特定道德价值集合的偏见。我们分析了已知的LLMs,发现它们展现出特定的道德基础,并展示这些如何与人类道德基础及政治归属相关联。我们还测量了这些偏见的一致性,即其是否随模型提示上下文的不同而强烈变化。最后,我们展示可以对抗性地选择提示,以鼓励模型展现特定的道德基础集合,而这会影响模型在下游任务上的行为。这些发现有助于阐明LLMs秉持特定道德立场的潜在风险与意外后果。
引用
@article{arxiv.2310.15337,
title = {Moral Foundations of Large Language Models},
author = {Marwa Abdulhai and Gregory Serapio-Garcia and Clément Crepy and Daria Valter and John Canny and Natasha Jaques},
journal= {arXiv preprint arXiv:2310.15337},
year = {2023}
}