中文

人类与卷积神经网络在场景分类中是否关注相似区域:任务与图像类型的影响

计算机视觉与模式识别 2024-08-20 v2 人工智能 人机交互

摘要

卷积神经网络(CNN)等深度学习模型是强大的图像分类器,但哪些因素决定了它们是否像人类一样关注相似的图像区域?以往研究多聚焦于技术因素,而关于影响人类注意力的因素所起作用则知之甚少。在本研究中,我们探讨了用于引发人类注意力图的任务如何与图像特征交互,从而调节人类与 CNN 之间的相似性。我们改变了人类任务的意向性,从分类过程中的自发注视,到有意注视定点,再到手动区域选择。此外,我们改变了待分类图像的类型,使用单一显著物体、由物体排列构成的室内场景,或无明确界定类别物体的景观。以此方式生成的人类注意力图与通过可解释人工智能(Grad-CAM)揭示的 CNN 注意力图进行了比较。人类任务的影响强烈依赖于图像类型:对于物体,人类手动选择产生的图与 CNN 最为相似,而具体的眼动任务影响甚微;对于室内场景,自发注视产生的相似性最低;对于景观,所有人类任务的相似性均同样较低。为了更好地理解这些结果,我们还将这些不同的人类注意力图相互进行了比较。我们的结果凸显了在比较人类与 CNN 注意力时考虑人类因素的重要性。

关键词

引用

@article{arxiv.2307.13345,
  title  = {Do humans and Convolutional Neural Networks attend to similar areas during scene classification: Effects of task and image type},
  author = {Romy Müller and Marcel Dürschmidt and Julian Ullrich and Carsten Knoll and Sascha Weber and Steffen Seitz},
  journal= {arXiv preprint arXiv:2307.13345},
  year   = {2024}
}