大型语言模型在道德与价值判断中的惯性
计算与语言
2026-04-21 v3 人工智能
人机交互
摘要
大型语言模型 (LLM) 表现出非确定性,指引其输出的常用方法是赋予其角色以产生更具变异性和情境敏感性的响应,类似于人类个体间响应的差异。尽管角色指引预期能产生广泛的意见,但我们的实验表明,LLM 在其响应中保持一致的价值倾向。我们观察到其响应在不同角色设置下对某些道德和价值维度(尤其是避免伤害和公平)保持偏斜的持久惯性。为研究此问题,我们使用大规模角色扮演, 将随机化的角色提示与模型输出的宏观分析配对。我们的结果表明,LLM 具有强大的内部偏见和价值偏好,我们称之为价值倾向和惯性。这些模型在需要平衡输出的应用中需要受到审视和调整。
引用
@article{arxiv.2408.09049,
title = {Inertia in Moral and Value Judgments of Large Language Models},
author = {Bruce W. Lee and Yeongheon Lee and Hyunsoo Cho},
journal= {arXiv preprint arXiv:2408.09049},
year = {2026}
}
备注
ACL 2026