中文

DeepRare:通用无监督视觉注意模型

计算机视觉与模式识别 2021-09-24 v1 人工智能

摘要

人类视觉系统在工程领域被建模,提供了特征工程方法,将图像中对比性强/令人惊讶/不寻常的数据检测出来。这类数据对人类而言“有趣”,并带来了众多应用。深度学习(DNNs)大幅提升了算法在主要基准数据集上的效率。然而,基于 DNN 的模型反直觉:令人惊讶或不寻常的数据因其低出现概率而本质上难以学习。实际上,基于 DNN 的模型主要学习自上而下特征,如人脸、文本、人或动物等通常吸引人类注意力的内容,但在提取图像中令人惊讶或不寻常的数据方面效率较低。在本文中,我们提出一种称为 DeepRare2021(DR21)的新视觉注意模型,它利用了 DNN 特征提取的能力与特征工程算法的通用性。该算法是基于一个通用框架的前一版本 DeepRare2019(DR19)的演进。DR21 1) 不需要任何训练并使用默认的 ImageNet 训练,2) 即使在 CPU 上也很快,3) 在四个差异很大的眼动追踪数据集上进行了测试,表明 DR21 具有通用性,并且在所有数据集和指标上始终处于顶尖模型之列,而其他模型无一展现出如此的规律性与通用性。最后 DR21 4) 使用若干网络架构如 VGG16(V16)、VGG19(V19)和 MobileNetV2(MN2)进行了测试,并且 5) 尽管使用了基于 DNN 的特征提取器,它仍提供了关于图像哪些部分在不同层次上最令人惊讶的解释与透明度。DeepRare2021 代码见 https://github.com/numediart/VisualAttention-RareFamil。

关键词

引用

@article{arxiv.2109.11439,
  title  = {DeepRare: Generic Unsupervised Visual Attention Models},
  author = {Phutphalla Kong and Matei Mancas and Bernard Gosselin and Kimtho Po},
  journal= {arXiv preprint arXiv:2109.11439},
  year   = {2021}
}

备注

Submited to journal, 36 pages. arXiv admin note: substantial text overlap with arXiv:2005.12073