中文

ViTmiX: 通过混合可视化方法增强 Vision Transformer 的可解释性

计算机视觉与模式识别 2024-12-20 v1

摘要

Vision Transformer (ViT) 的最新进展在各种视觉识别任务中展现出了卓越的结果,这得益于其通过自注意力机制捕获图像中长距离依赖关系的能力。然而,ViT 模型的复杂性要求有稳健的可解释性方法来揭示其决策过程。可解释人工智能 (XAI) 通过提供对模型预测的洞察,在提高模型透明度和可信度方面发挥着至关重要的作用。当前基于可视化技术(如逐层相关性传播 (LRP) 和基于梯度的方法)的 ViT 可解释性方法已显示出有希望但有时有限的结果。在本研究中,我们探索了一种混合方法,该方法混合了多种可解释性技术以克服这些限制并增强 ViT 模型的可解释性。我们的实验表明,与单独的方法相比,这种混合方法显著提高了 ViT 模型的可解释性。我们还对现有技术进行了修改,例如使用几何平均进行混合,这在目标分割任务中展示了显著的结果。为了量化可解释性的增益,我们通过应用抽屉原理引入了一种新颖的事后可解释性度量。这些发现突出了改进和优化 ViT 模型可解释性方法的重要性,为可靠的基于 XAI 的分割铺平了道路。

关键词

引用

@article{arxiv.2412.14231,
  title  = {ViTmiX: Vision Transformer Explainability Augmented by Mixed Visualization Methods},
  author = {Eduard Hogea and Darian M. Onchis and Ana Coporan and Adina Magda Florea and Codruta Istin},
  journal= {arXiv preprint arXiv:2412.14231},
  year   = {2024}
}