中文

循环消融:在 AI 中测试概念定位与功能再生

计算与语言 2025-10-01 v1 机器学习

摘要

安全性和可控性对于大语言模型至关重要。一个核心问题是,欺骗等不良行为是否是可以被移除的局部功能,还是与模型的核心认知能力深度交织。我们引入了“循环消融”,一种用于测试此问题的迭代方法。通过在 DistilGPT-2 上结合稀疏自编码器、定向消融和对抗训练,我们试图消除欺骗概念。我们发现,与定位假说相反,欺骗具有高度韧性。模型在每次消融周期后通过对抗训练持续恢复其欺骗行为,我们将此过程称为功能再生。关键的是,每次这种“神经外科手术”的尝试都导致了通用语言性能的逐渐但可测量的衰退,表现为困惑度的持续上升。这些发现与复杂概念是分布式且纠缠在一起的观点相一致,强调了通过机制可解释性进行直接模型编辑的局限性。

关键词

引用

@article{arxiv.2509.25220,
  title  = {Cyclic Ablation: Testing Concept Localization against Functional Regeneration in AI},
  author = {Eduard Kapelko},
  journal= {arXiv preprint arXiv:2509.25220},
  year   = {2025}
}

备注

Code is available at: https://www.kaggle.com/code/kapedalex/cycleablationpublic/