大语言模型中的道德说服:评估易感性与伦理对齐
计算与语言
2024-11-19 v1 人工智能
摘要
我们探讨如何通过提示大语言模型(LLM)改变其初始决策,使其与既定伦理框架对齐,从而研究 LLM 如何受到影响。我们的研究基于两个旨在评估 LLM 对道德说服易感性的实验。在第一个实验中,我们通过在道德模糊场景下评估基础智能体 LLM,并观察说服者智能体如何尝试修改基础智能体的初始决策,来检验其对道德模糊的易感性。第二个实验通过提示 LLM 采纳根植于既定哲学理论的特定价值对齐,评估 LLM 与预定义伦理框架对齐的易感性。结果表明,在涉及道德判断的场景中 LLM 确实可以被说服,且说服的成功与否取决于所用模型、场景复杂度以及对话长度等因素。值得注意的是,来自同一公司但规模不同的 LLM 产生了显著不同的结果,凸显了它们对伦理说服易感性的差异性。
引用
@article{arxiv.2411.11731,
title = {Moral Persuasion in Large Language Models: Evaluating Susceptibility and Ethical Alignment},
author = {Allison Huang and Yulu Niki Pi and Carlos Mougan},
journal= {arXiv preprint arXiv:2411.11731},
year = {2024}
}