注意力格子适配器:用于视觉基础模型的视觉解释生成
计算机视觉与模式识别
2025-09-19 v1
摘要
在本研究中,我们考虑了为视觉基础模型生成视觉解释的问题。已提出许多方法用于此目的;然而,它们常常由于缺乏可适应性而无法应用于复杂模型。为克服这些限制,我们提出了一种新的视觉解释生成方法,旨在生成解释并部分更新模型参数以增强可解释性。我们的ethods 引入了两种新机制:注意力格子适配器(ALA)和交替周期架构(AEA)。ALA机制通过消除对手动图层选择的需求,从而简化了过程,增强了模型的可适应性和可解释性。此外,AEA机制每隔一个周期更新ALA的参数,有效地解决了注意力区域过小的常见问题。我们在两个基准数据集上对方法进行了评估:CUB-200-2011和ImageNet-S。我们的结果表明,我们的方法在CUB-200-2011和ImageNet-S数据集上的平均交并比(IoU)、插入得分、删除得分和插入-删除得分均优于基线方法。值得注意的是,我们的最佳模型在CUB-200-2011数据集上的平均IoU比基线方法提高了53.2分。
引用
@article{arxiv.2509.14664,
title = {Attention Lattice Adapter: Visual Explanation Generation for Visual Foundation Model},
author = {Shinnosuke Hirano and Yuiga Wada and Tsumugi Iida and Komei Sugiura},
journal= {arXiv preprint arXiv:2509.14664},
year = {2025}
}
备注
Accepted for presentation at ICONIP2025