中文

编辑是否为局部化提供证据?

机器学习 2025-02-20 v2 人工智能

摘要

解释性研究中关于大型语言模型(LLM)的一个基本目标是将语义上有意义的行为“局部化”到 LLM 内部的特定组件中。存在各种用于寻找 LLM 中候选位置的启发式方法。一旦发现某个候选局部化位置,即可通过编辑相应局部化位置的内部表示来评估其有效性,检查是否诱导与该局部化语义解释一致的模型行为。本文聚焦的问题是:此类编辑如何能否作为局部化的证据。为评估局部化论证,我们需要评估在特定位置进行最优干预的效果。我们的关键新技术工具是将 LLM 对齐技术应用于寻找此类最优局部化编辑的方法。凭借此工具,我们给出一个案例,其中基于编辑的局部化证据看似较强,但实际上局部化明显失败。事实上,我们发现随机局部化处的最优编辑效果不逊于完整模型对齐。在总体上,我们的结果表明,仅观察局部化编辑诱导特定行为变化,几乎不提供任何关于这些位置是否实际编码目标行为的证据。

关键词

引用

@article{arxiv.2502.11447,
  title  = {Does Editing Provide Evidence for Localization?},
  author = {Zihao Wang and Victor Veitch},
  journal= {arXiv preprint arXiv:2502.11447},
  year   = {2025}
}