中文

WASD:定位关键神经元作为解释和控制大语言模型行为的充分条件

计算与语言 2026-04-10 v2 人工智能

摘要

对大语言模型(LLM)行为的精确控制对复杂应用至关重要。然而,现有方法常带来高昂的训练成本、缺乏自然语言可控性或损害语义连贯性。为弥合这一差距,我们提出 WASD(unWeaving Actionable Sufficient Directives),一个通过识别 token 生成的充分神经条件来解释模型行为的新型框架。我们的方法将候选条件表示为神经元激活谓词,并迭代搜索在输入扰动下保证当前输出的最小集合。在 SST-2 和 CounterFact 上使用 Gemma-2-2B 模型的实验表明,我们的方法产生的解释比传统归因图更稳定、准确和简洁。此外,通过一项控制跨语言输出生成的案例研究,我们验证了 WASD 在控制模型行为方面的实际有效性。

关键词

引用

@article{arxiv.2603.18474,
  title  = {WASD: Locating Critical Neurons as Sufficient Conditions for Explaining and Controlling LLM Behavior},
  author = {Haonan Yu and Junhao Liu and Zhenyu Yan and Haoran Lin and Xin Zhang},
  journal= {arXiv preprint arXiv:2603.18474},
  year   = {2026}
}