中文

价值表达的双重机制:内在价值 vs. 提示价值在大语言模型中的表现

计算与语言 2026-02-02 v3 人工智能

摘要

大语言模型可以通过两种主要方式表达价值:(1) 内在表达,反映模型在训练期间所学习的内在价值;(2) 提示表达式,通过明确的提示被激发。鉴于其在价值对齐中的广泛应用,清晰理解其背后机制尤为重要,特别是它们是否主要重叠(如人们所期望的)或依赖于不同机制,但这在很大程度上尚未得到充分研究。我们采用两种方法进行机制层面的分析:(1) 价值向量,代表价值机制的特征方向,从残差流中提取;(2) 价值神经元,对贡献于价值向量的MLP神经元。我们展示了,内在价值机制与提示价值机制部分共享关键组件,对于引发价值表达至关重要,能够在不同语言之间推广,并在模型内部表示中重建理论上的价值间相关性。然而,由于这些机制也具有独特元素,能够履行不同角色,因此导致不同的响应多样性(内在 > 提示)和价值可调性(提示 > 内在)。特别是,仅属于内在机制的组件促进了响应中的词汇多样性,而仅属于提示机制的组件则强化了指令遵循,甚至在如跳转攻击等遥远任务中也会发挥作用。

关键词

引用

@article{arxiv.2509.24319,
  title  = {Dual Mechanisms of Value Expression: Intrinsic vs. Prompted Values in Large Language Models},
  author = {Jongwook Han and Jongwon Lim and Injin Kong and Yohan Jo},
  journal= {arXiv preprint arXiv:2509.24319},
  year   = {2026}
}