中文

定位、操控与改进:大型语言模型中可操作机制可解释性实用综述

计算与语言 2026-04-15 v4

摘要

机制可解释性(MI)已成为揭示大型语言模型(LLM)不透明决策过程的重要方法。然而,现有综述主要将 MI 视为一门观察科学,总结分析性见解,但缺乏一个用于可操作干预的系统性框架。为了弥补这一差距,我们围绕“定位、操控和改进”这一流程,提出了一篇实用综述。我们基于特定的可解释对象,对定位(诊断)和操控(干预)方法进行了形式化分类,以建立一个严谨的干预协议。此外,我们展示了该框架如何在对齐、能力和效率方面实现切实的改进,从而有效地将 MI 操作化为一种用于模型优化的可操作方法。本工作的精选论文列表可在 https://github.com/rattlesnakey/Awesome-Actionable-MI-Survey 获取。

关键词

引用

@article{arxiv.2601.14004,
  title  = {Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models},
  author = {Hengyuan Zhang and Zhihao Zhang and Mingyang Wang and Zunhai Su and Yiwei Wang and Qianli Wang and Shuzhou Yuan and Ercong Nie and Xufeng Duan and Feijiang Han and Qibo Xue and Zeping Yu and Chenming Shang and Xiao Liang and Jing Xiong and Hui Shen and Chaofan Tao and Zhengwu Liu and Senjie Jin and Zhiheng Xi and Dongdong Zhang and Sophia Ananiadou and Tao Gui and Ruobing Xie and Hayden Kwok-Hay So and Hinrich Schütze and Xuanjing Huang and Qi Zhang and Ngai Wong},
  journal= {arXiv preprint arXiv:2601.14004},
  year   = {2026}
}