中文

几何自适应解释器:分布迁移下基于字典的可信解释性

机器学习 2026-05-22 v1 计算与语言

摘要

机制解释性旨在通过识别模型内部中负责因果关系的结构来解释模型的行为。字典式解释器,如稀疏自编码器和转码器,是主要工具之一,但其在分布外(OOD)迁移下的可信度受到了很少的系统性关注。我们表明,分布迁移会旋转模型实际使用的子空间,导致在训练分布内(ID)激活时训练的解释器字典与 OOD 活动子空间错位。我们将这种错位形式化为可信度间隙——ID 字典与 OOD 活动子空间之间的几何距离,并说明它控制 OOD 可信度的退化。为缩小此间隙,我们提出了几何自适应解释器(GAE),其通过保持原始特征结构的同时,将解释器字典重新对齐到 OOD 活动子空间。这只需要无标签的 OOD 激活,无需梯度更新。我们证明了 GAE 在未适应的 ID 解释器之上具有改进, excess loss 相对于间隙的平方项有上界。经验上,GAE 在多个模型和 OOD 设置下,甚至在因果可信度方面匹配或超越所有基于训练的方法。

关键词

引用

@article{arxiv.2605.21849,
  title  = {Geometry-Adaptive Explainer for Faithful Dictionary-Based Interpretability under Distribution Shift},
  author = {Sungjun Lim and Heedong Kim and Andrew Lee and Kyungwoo Song},
  journal= {arXiv preprint arXiv:2605.21849},
  year   = {2026}
}