中文

通过神经元级编辑实现大型语言模型中的可控价值对齐

机器学习 2026-02-10 v1

摘要

与人类价值观对齐的大型语言模型(LLM)正在变得越来越重要,因为它们对人类行为和决策的影响在扩大。然而,现有的基于引导的对齐方法存在可控性有限的问题:引导目标价值时会意外激活其他非目标价值。为了描述这一限制,我们引入了价值泄漏,这是一种诊断性概念,捕捉价值引导期间非目标价值意外激活的情况,并提出了基于施瓦茨价值理论的归一化泄漏度量。在此基础上,我们提出了NeVA,这是一个用于LLM中可控价值对齐的神经元级编辑框架。NeVA识别稀疏的、与价值相关的神经元并执行推理时的激活编辑,从而实现细粒度控制,而无需参数更新或重新训练。实验表明,NeVA实现了更强的目标价值对齐,同时对一般能力的性能损失更小。此外,NeVA显著减少了平均泄漏,残余效应主要局限于语义上相关的价值类别。总体而言,NeVA提供了一种更可控、更可解释的价值对齐机制。

关键词

引用

@article{arxiv.2602.07356,
  title  = {Controllable Value Alignment in Large Language Models through Neuron-Level Editing},
  author = {Yonghui Yang and Junwei Li and Jilong Liu and Yicheng He and Fengbin Zhu and Weibiao Huang and Le Wu and Richang Hong and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2602.07356},
  year   = {2026}
}