中文

重构引导的注意力提升神经网络的鲁棒性与形状处理能力

计算机视觉与模式识别 2023-02-09 v2 人工智能 机器学习 神经元与认知

摘要

许多视觉现象表明,人类利用自上而下的生成或重构过程来形成视觉感知(例如意象、物体补全、空想性错视),但关于重构在鲁棒物体识别中所起作用知之甚少。我们构建了一个迭代式编码器-解码器网络,该网络生成物体重构,并将其用作自上而下的注意力反馈,以将最相关的空间与特征信息路由至前馈物体识别过程。我们使用具有挑战性的分布外数字识别数据集 MNIST-C 对该模型进行了测试,该数据集对手写数字图像施加了 15 种不同类型的变换与损坏。我们的模型对各种图像扰动表现出很强的泛化性能,平均优于包括前馈 CNN 和对抗训练网络在内的所有其他模型。我们的模型对模糊、噪声和遮挡损坏尤其鲁棒,而在这类情况下形状感知起着重要作用。消融实验进一步揭示了空间注意力与基于特征的注意力在鲁棒物体识别中的两种互补作用:前者在很大程度上与注意力文献中的空间掩蔽增益一致(重构充当掩蔽),后者主要通过缩小可能物体假设的空间来提升模型的推理速度(即达到某一置信阈值所需的时间步数)。我们还观察到,该模型有时会由噪声中幻视出不存在的模式,从而导致高度可解释的类人错误。我们的研究表明,对基于重构的反馈进行建模可为 AI 系统赋予一种强大的注意力机制,有助于我们理解生成感知在人类视觉处理中的作用。

关键词

引用

@article{arxiv.2209.13620,
  title  = {Reconstruction-guided attention improves the robustness and shape processing of neural networks},
  author = {Seoyoung Ahn and Hossein Adeli and Gregory J. Zelinsky},
  journal= {arXiv preprint arXiv:2209.13620},
  year   = {2023}
}

备注

paper accepted to SVRHM, Neurips workshop 2022