价值对齐税:衡量 LLM 对齐中的价值权衡
人工智能
2026-04-28 v2 人机交互
摘要
现有价值对齐工作通常静态地刻画价值关系,忽略了对齐干预(如提示词、微调或偏好优化)如何重塑更广泛的价值体系。在实际操作中,对齐目标价值可能隐式地影响其他价值,产生尚未被充分衡量的价值权衡。我们引入VAT框架,通过衡量对齐引起的变化如何在相互关联的价值之间传播,相对于实现的目标收益来量化价值权衡。VAT捕捉了价值表达在对齐干预下的系统级动态,使能够评估既定的改进以及意外的副作用。运用基于熊史瓦尔希价值理论的受控情景-行动数据集,我们收集了前后规范性判断的配对数据,并分析了不同模型、价值和干预下的对齐效果。结果表明,对齐常常在价值之间产生不均衡且结构化的共同运动,揭示了目标价值与非目标价值之间的系统性权衡。这些效应在传统仅关注目标的评估中几乎不可见,但通过VAT便显现出来,凸显了对齐过程中的风险,并为理解LLM中价值对齐的动态本质提供了新视角。数据集和代码已开源。
引用
@article{arxiv.2602.12134,
title = {Value Alignment Tax: Measuring Value Trade-offs in LLM Alignment},
author = {Jiajun Chen and Hua Shen},
journal= {arXiv preprint arXiv:2602.12134},
year = {2026}
}
备注
Preprint. Under review. 20 pages, 13 figures