通过基于行为的价值对齐来应对决策中的表面性影响
计算与语言
2026-05-28 v1
摘要
大语言模型(LLM)越来越被部署在高风险决策场景中,如法律推理,因而在事实等价输入下必须保持一致性。然而,我们发现,虽然保持事实但表述不同的输入会显著 destabilize LLM 的决策。为系统性地调查这一问题,我们引入了 Fragile,一个大型基准,隔离了三个受控维度上的事实保存语义表面性影响:价值色彩的叙述、时间切片和叙事鲜活度。我们的实验显示,LLM 对表面性影响高度敏感,平均决策翻转率为 28.6%。我们发现,简单的前置提示水平和激活水平干预不仅无法抑制表面性敏感性,反而会放大它。因此,我们提出了 Valign,一种表示水平方法,通过锚定到稳定的价值先验、引导隐藏状态朝向模型价值一致方向,并从模型的隐藏状态中投射掉受时间鲜活度敏感的方向来显式针对这些表面性维度。Valign 持续地减少了由表面性导致的决策翻转,表明稳健的缓解需要直接针对表面性操作的内部通道。
引用
@article{arxiv.2605.28188,
title = {Framing Matters: Addressing Framing Sensitivity in Decision-Making through Behaviorally-Grounded Value Alignment},
author = {Seojin Hwang and Minju Kim and Junhyuk Choi and JeongHyun Park and Hwanhee Lee},
journal= {arXiv preprint arXiv:2605.28188},
year = {2026}
}
备注
29 pages, 7 figures, 31 tables