中文

Gnothi Seauton:赋能黑盒Transformer的忠实自解释性

机器学习 2025-02-26 v2 人工智能 计算与语言 计算机视觉与模式识别 计算机科学与博弈论

摘要

自解释模型与黑盒模型的事后解释之间的争论是可解释人工智能(XAI)的核心。自解释模型,例如基于概念的模型,通过将决策与人类可理解的概念联系起来提供洞察,但往往在性能和可扩展性方面存在困难。相反,像Shapley值这样的事后方法,虽然在理论上很稳健,但计算成本高且资源密集。为了弥合这两条研究路线之间的差距,我们提出了一种结合它们优势的新方法,在不牺牲预测准确性的前提下,为黑盒模型提供理论上保证的自解释性。具体来说,我们引入了一个参数高效的管道,AutoGnothi,它将一个小型侧网络集成到黑盒模型中,使其能够生成Shapley值解释,而无需改变原始网络参数。这种侧调优方法显著降低了内存、训练和推理成本,优于传统的参数高效方法,其中全微调作为最优基线。AutoGnothi使黑盒模型能够以最小的开销预测并解释其预测。大量实验表明,AutoGnothi为视觉和语言任务提供了准确的解释,以可比的解释性提供了卓越的计算效率。

关键词

引用

@article{arxiv.2410.21815,
  title  = {Gnothi Seauton: Empowering Faithful Self-Interpretability in Black-Box Transformers},
  author = {Shaobo Wang and Hongxuan Tang and Mingyang Wang and Hongrui Zhang and Xuyang Liu and Weiya Li and Xuming Hu and Linfeng Zhang},
  journal= {arXiv preprint arXiv:2410.21815},
  year   = {2025}
}

备注

Accepted by ICLR 2025, 29 pages, 13 figures