无需额外训练将自解释模型的视觉可解释性迁移到预测模型
计算机视觉与模式识别
2026-02-03 v2 人工智能
机器学习
摘要
在需要同时满足预测和解释效率的图像分类场景中, 自解释模型能够在单次推理中完成两项任务, 因而有效。然而, 对已有预测模型的用户而言, 从零开始训练新的自解释模型在标签和计算成本方面存在显著挑战。本研究提出一种方法, 基于任务算术框架将自解释模型在源域中学习到的视觉解释能力迁移到目标域中的预测模型, 且无需额外训练。我们的自解释模型包含一种扩展Vision Transformer的架构, 使所提方法能够为许多已训练的预测模型无需额外训练地赋予解释能力。在 various图像分类数据集上的实验表明, 除少数相关性较小的域间迁移外, 从源域到目标域的视觉解释能力迁移成功, 且在不显著牺牲分类准确率的前提下, 提升了目标域中的解释质量。
关键词
引用
@article{arxiv.2507.04380,
title = {Transferring Visual Explainability of Self-Explaining Models to Prediction-Only Models without Additional Training},
author = {Yuya Yoshikawa and Ryotaro Shimizu and Takahiro Kawashima and Yuki Saito},
journal= {arXiv preprint arXiv:2507.04380},
year = {2026}
}