中文

ATCON:面向视觉模型的注意力一致性方法

计算机视觉与模式识别 2022-10-19 v1

摘要

注意力(或归因)图方法旨在突出模型输入中对预测具有判别性的区域。然而,不同的注意力图方法可能突出输入的不同区域,对同一个预测给出有时相互矛盾的解释。当训练集较小时,这一效应会加剧。这表明要么模型学习了错误的表征,要么注意力图方法未能准确估计模型的表征。我们提出了一种无监督微调方法,用于优化注意力图的一致性,并表明它同时提升了分类性能和注意力图的质量。我们针对两种最先进的注意力计算方法 Grad-CAM 和 Guided Backpropagation 给出了实现,其依赖于一种输入掩码技术。我们还在消融研究中展示了在 Grad-CAM 和 Integrated Gradients 上的结果。我们在为本工作汇总并整理的医院患者连续视频记录事件检测数据集上评估了该方法。作为合理性检验,我们还在 PASCAL VOC 和 SVHN 上评估了所提方法。使用所提方法,在小型训练集下,我们在视频数据集上相较基线实现了 F1 分数 6.6 个百分点的提升,在 PASCAL 上实现 F1 分数 2.9 个百分点的提升,以及在 PASCAL 上的弱监督检测中相较 Grad-CAM 实现平均交并比 1.8 个百分点的提升。这些改进的注意力图可帮助临床医生更好地理解视觉模型预测,并简化机器学习系统在临床护理中的部署。我们在以下代码仓库分享了本文的部分代码:https://github.com/alimirzazadeh/SemisupervisedAttention。

关键词

引用

@article{arxiv.2210.09705,
  title  = {ATCON: Attention Consistency for Vision Models},
  author = {Ali Mirzazadeh and Florian Dubost and Maxwell Pike and Krish Maniar and Max Zuo and Christopher Lee-Messer and Daniel Rubin},
  journal= {arXiv preprint arXiv:2210.09705},
  year   = {2022}
}

备注

WACV 2023