坏的神经元:隔离与手术式纠正迎合行为
机器学习
2026-01-28 v1
摘要
大型语言模型(LLM)的行为对齐通常通过宽泛的微调实现,但可能导致分布性偏移和可解释性低等问题。我们提出了一种对齐方法,通过识别和更新仅负责特定行为的神经元来实现,这是一种受限的方法,允许使用大幅度减少的数据进行微调。利用稀疏自动编码器(SAEs)和线性探针,我们隔离最能预测目标行为的 3% 的 MLP 神经元,将其解码到残差空间中,并仅对这些神经元使用梯度遮蔽进行微调。我们在减少迎合行为的任务上展示了这一方法,其中我们的 method 在四个基准测试(Syco-Bench、NLP、POLI、PHIL)上匹配或超越了最先进的性能,模型使用 Gemma-2-2B 和 9B。我们的结果表明,稀疏的神经元级更新为全模型微调提供了可扩展且精确的替代方案,即使在数据有限的情况下也能保持有效。
引用
@article{arxiv.2601.18939,
title = {A Few Bad Neurons: Isolating and Surgically Correcting Sycophancy},
author = {Claire O'Brien and Jessica Seto and Dristi Roy and Aditya Dwivedi and Sunishchal Dev and Kevin Zhu and Sean O'Brien and Ashwinee Panda and Ryan Lagasse},
journal= {arXiv preprint arXiv:2601.18939},
year = {2026}
}
备注
Accepted to NeurIPS Workshop on CogInterp and NeurIPS Workshop on Reliable ML 2025