中文

基于可识别时空-瞬时表征的 LLM 可解释性

机器学习 2026-01-06 v2

摘要

尽管大型语言模型 (LLM) 具备卓越的能力,但仍难以理解其内部表征。稀疏自编码器 (SAEs) 等机制可解释性工具已用于从 LLM 中提取可解释特征,但缺乏时序依赖建模、瞬时关系表征,更重要的是缺乏理论保证,这削弱了其理论基础以及后续分析所需的实际信心。虽然因果表征学习 (CRL) 提供了基于理论的揭示潜在概念的方法,但现有方法因计算效率低,无法扩展到 LLM 丰富的概念空间。为弥合这一差距,我们引入一个专为 LLM 高维概念空间设计的、可识别的时空因果表征学习框架,既捕获时延迟因果关系,又捕获瞬时因果关系。我们的 methods 提供理论保证,并在规模匹配真实世界复杂度的合成数据集上Demonstrate有效性。通过将我们的时空因果框架扩展于 SAE 技术,我们成功发现了 LLM 激活值中的有意义概念关系。我们的发现表明,同时建模时序和瞬时概念关系有助于提升 LLM 的可解释性。

关键词

引用

@article{arxiv.2509.23323,
  title  = {LLM Interpretability with Identifiable Temporal-Instantaneous Representation},
  author = {Xiangchen Song and Jiaqi Sun and Zijian Li and Yujia Zheng and Kun Zhang},
  journal= {arXiv preprint arXiv:2509.23323},
  year   = {2026}
}

备注

NeurIPS 2025