知道却不行动:LLM中的价值对齐与行为差异
计算与语言
2026-01-14 v1
摘要
价值对齐是开发安全且符合社会规范的人工智能的核心问题。然而,大型语言模型(LLM)如何在实际决策情境中代表和实现人类价值仍有待探讨。我们提出ValAct-15k数据集,源自Reddit的3000个寻求建议情景,用于引出舍弗理论(Schwartz Theory of Basic Human Values)中定义的十种价值。我们使用情景问题和传统价值问卷,评估十个前沿LLM(来自美国公司的五个,来自中国公司的五个)以及人类参与者(n=55)。我们发现情景决策中几乎所有模型之间一致性极高(Pearson r≈1.0),与人类之间广泛变异性(r∈[-0.79, 0.98])形成鲜明对比。然而,人类和LLM在自我报告价值与实际执行价值之间表现出弱相关性(r=0.4, 0.3),揭示了系统性的知识-行动鸿沟。当被指示“坚持”特定价值时,LLM的表现比仅选择该价值下降最高达6.6%,表明存在角色扮演回避现象。这些发现表明,虽然对齐训练产生了规范性价值收敛,但并未消除人类在知道和行动价值之间存在的incoherence。
引用
@article{arxiv.2601.07972,
title = {Knowing But Not Doing: Convergent Morality and Divergent Action in LLMs},
author = {Jen-tse Huang and Jiantong Qin and Xueli Qiu and Sharon Levy and Michelle R. Kaufman and Mark Dredze},
journal= {arXiv preprint arXiv:2601.07972},
year = {2026}
}
备注
9 pages, 7 figures