大语言模型角色扮演下的道德易感性与鲁棒性
计算与语言
2026-05-15 v3 人工智能
计算机与社会
摘要
大语言模型(LLMs)越来越多地在社会语境中运行,这促使人们分析它们如何表达和改变道德判断。在这项工作中,我们研究了 LLMs 对角色扮演的道德反应,即提示 LLM 扮演特定角色。使用道德基础问卷(MFQ),我们引入了一个基准来量化两个属性:道德易感性和道德鲁棒性,这两个属性由跨角色和角色内 MFQ 分数的变异性定义。我们使用两种互补的流程来估计这些量:重复采样,以及一种直接估计评分分布并支持温度分析的基于 logit 的方法。我们在六个系列中评估了15个模型:Claude、DeepSeek、Gemini、GPT、Grok 和 Llama。这两个指标显示出定性上不同的模式。道德鲁棒性的差异超过一个数量级,变异系数约为 ,这几乎完全由模型系列解释。Claude 系列在显著程度上是最鲁棒的,比表现较差的系列(DeepSeek、Grok 和 Llama)高出约30倍,而 Gemini 和 GPT 处于中间梯队。这种强烈的系列依赖性表明,鲁棒性主要由训练后阶段塑造。相比之下,道德易感性跨越的范围要窄得多,变异系数约为 ,且最易感的模型仅比最不易感的模型高1.6倍。与鲁棒性不同,易感性没有表现出明显的系列依赖性,表明它主要由预训练决定。此外,我们还展示了无角色扮演的模型以及跨模型平均的角色的道德基础概况。这些分析共同提供了一个系统视角,揭示了角色条件化如何塑造 LLMs 的道德行为,并为了解它们用于实例化角色的内部机制提供了一个窗口。
引用
@article{arxiv.2511.08565,
title = {Moral Susceptibility and Robustness under Persona Role-Play in Large Language Models},
author = {Davi Bastos Costa and Felippe Alves and Renato Vicente},
journal= {arXiv preprint arXiv:2511.08565},
year = {2026}
}
备注
Added experiments with a logit-based method and now reporting unbounded metrics