中文

迈向稳定价值对齐:引入独立模块实现一致的价值引导

人工智能 2026-05-13 v1

摘要

将大语言模型(LLMs)与人类价值对齐通常依赖于直接操纵骨干网络参数或表征空间的训练后或推理时引导。然而,存在一个关键缺陷:模型的残差流是高度动态的,其中价值以脆弱、低维的属性存在,本质上与一致价值表达所需的稳定性不相容。本文提出稳定价值引导Transformer(SVGT),通过一个包含两项关键设计的独立价值模块来解决这一缺陷:(1)独立价值建模,在与骨干网络隔离的专用价值空间中维持规范性表征;(2)显式行为引导,将这些稳定信号转换为可学习的潜在桥接令牌(Bridge Tokens)。这些令牌作为动态价值锚点,显式地引导生成轨迹,确保在不同语境下稳健地遵循价值,同时不干扰骨干网络的内部表征。在多个骨干网络和安全基准上的实验表明,SVGT通常能将有害评分降低70%以上,同时保持生成流畅性,证明了基于架构的价值建模的有效性。我们的代码可在 https://github.com/Clervils/SVGT.git 获取。

关键词

引用

@article{arxiv.2605.11712,
  title  = {Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance},
  author = {Wenhao Chen and Sirui Sun and Shengyuan Bai and Guojie Song},
  journal= {arXiv preprint arXiv:2605.11712},
  year   = {2026}
}

备注

Accepted to ICML 2026 (Spotlight). 32 pages