中文

价值纠缠:大型语言模型中不同善的混合

计算与语言 2026-02-24 v1 人工智能

摘要

大型语言模型(LLM)的价值对齐要求我们实证测量这些模型实际获取的价值表征。在人类价值表征的特征中,他们会区分不同类型的价值。我们探讨LLM是否同样区分三种不同的善:道德善、语法善与经济善。通过探测模型行为、嵌入及残差流激活,我们报告了普遍的价值纠缠现象:不同价值表征之间的混合。具体而言,语法价值与经济价值的评估相对于人类规范而言,均受到道德价值的过度影响。这种纠缠通过选择性消除与道德相关的激活向量后可被修复。

关键词

引用

@article{arxiv.2602.19101,
  title  = {Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models},
  author = {Seong Hah Cho and Junyi Li and Anna Leshinskaya},
  journal= {arXiv preprint arXiv:2602.19101},
  year   = {2026}
}