理解价值神经元如何塑造 LLM 中指定值的生成
计算与语言
2025-05-26 v1
摘要
大型语言模型(LLM)的快速融入社会应用加剧了对其是否符合普遍伦理原则的担忧,因为其内部价值表征虽已取得行为对齐进展,却仍不为人所知。现有方法在解释价值如何在神经网络架构中编码方面受限,主要受限于那些优先关注表面判断而非机制性分析的数据集。我们引入ValueLocate,一个基于萨舒尔价值调查(Schwartz Values Survey)的机制可解释性框架,以解决这一问题。我们方法首先构建ValueInsight,一个将四个普遍价值维度通过行为情境在真实世界中实现的 dataset。凭借该 dataset,我们开发了一种神经元识别方法,计算 opposing value aspects 之间的激活差异,从而在不依赖计算密集型归因方法的情况下精确定位价值关键神经元。我们提出的验证方法表明,对这些神经元进行针对性操控可有效改变模型的价值取向,从而建立了神经元与价值表征之间的因果关系。这一工作为价值对齐奠定了基础,通过将心理学价值框架与 LLM 中的神经元分析相结合,推动了该领域的发展。
引用
@article{arxiv.2505.17712,
title = {Understanding How Value Neurons Shape the Generation of Specified Values in LLMs},
author = {Yi Su and Jiayi Zhang and Shu Yang and Xinhai Wang and Lijie Hu and Di Wang},
journal= {arXiv preprint arXiv:2505.17712},
year = {2025}
}