中文

语言模型是否对道德无关的干扰因素敏感?

计算与语言 2026-02-11 v1 计算机与社会

摘要

随着大型语言模型(LLM)在高风险场景中的快速发展和采纳,确保 LLM 行为符合人类价值观日益重要。现有的道德基准测试以价值陈述、道德情景或心理问卷形式呈现 LLM,隐含假设是 LLM 报告某种稳定的道德偏好。然而,道德心理学研究表明,人类道德判断对道德无关的情境因素敏感,例如闻到肉桂卷饼或环境噪声水平,从而挑战假设人类道德判断稳定的道德理论。本文受此“情境主义”道德心理学观点的启发,评估 LLM 是否 exhibit 类似的人类认知道德偏差。我们构建了一个包含 60 个“道德干扰因素”的多模态数据集,这些干扰因素来自现有情感价值图像和叙事数据集,与所呈现情境无关。将这些干扰因素注入现有道德基准测试以衡量其对 LLM 回应的影响后,我们发现道德干扰因素可使 LLM 在低歧义情境下将道德判断偏移超过 30%,凸显需要更精细的情境道德评估以及更细致的 LLM 认知道德建模的必要性。

关键词

引用

@article{arxiv.2602.09416,
  title  = {Are Language Models Sensitive to Morally Irrelevant Distractors?},
  author = {Andrew Shaw and Christina Hahn and Catherine Rasgaitis and Yash Mishra and Alisa Liu and Natasha Jaques and Yulia Tsvetkov and Amy X. Zhang},
  journal= {arXiv preprint arXiv:2602.09416},
  year   = {2026}
}