中文

致以分心:通过视觉解释技术实现 CNN 分类器的鲁棒训练

计算机视觉与模式识别 2021-07-30 v3 人工智能

摘要

深度学习领域正朝着不同方向发展,但仍然需要更高效的训练策略。在这项工作中,我们提出了一种新颖且鲁棒的训练方案,将视觉解释技术整合到学习过程中。与关注图像相关部分的注意力机制不同,我们旨在通过使模型也关注其他区域来提高其鲁棒性。广义上讲,该想法是在学习过程中分散分类器的注意力,迫使其不仅关注相关区域,还关注那些先验上对类别区分信息量不大的区域。我们通过将所提方法嵌入到卷积神经网络的两个知名数据集(即 Stanford cars 和 FGVC-Aircraft)的分析与分类学习过程中,测试了该方法。此外,我们在真实场景下评估了我们的模型,用于自我中心图像的分类,这使我们能够获得关于人们生活方式的相关信息。特别是,我们在具有挑战性的 EgoFoodPlaces 数据集上进行了研究,以较低的复杂度取得了 SOTA 结果。所得结果表明,我们提出的训练方案适用于图像分类,并提高了最终模型的鲁棒性。

关键词

引用

@article{arxiv.2012.14173,
  title  = {Playing to distraction: towards a robust training of CNN classifiers through visual explanation techniques},
  author = {David Morales and Estefania Talavera and Beatriz Remeseiro},
  journal= {arXiv preprint arXiv:2012.14173},
  year   = {2021}
}

备注

20 pages,3 figures, 4 tables