RetinotopicNet:一种结合局部描述子与全局上下文的迭代注意力机制
计算机视觉与模式识别
2020-05-13 v1 机器学习
图像与视频处理
摘要
卷积神经网络(CNN)是近年来计算机视觉研究诸多进展的驱动力。这些进展催生了许多实际应用,使得当今对将 CNN 高效部署到嵌入式系统的需求日益增加。然而,传统 CNN 缺乏尺度与旋转不变性:这是自然图像中最常遇到的两种变换。因此,CNN 必须为不同尺度下的相同物体学习不同的特征。这种冗余是 CNN 为了达到预期精度而需要极深网络结构的主要原因。在本文中,我们通过重现人类大脑解决该问题的方式来开发一种高效的解决方案。为此,我们让 CNN 在通过 log-polar 变换提取的小图像块上进行操作,该变换已知具有尺度与旋转等变性。以这种方式提取的图像块具有放大中心视野并压缩外围的良好特性。因此,我们获得了带有全局上下文信息的局部描述子。然而,处理单个图像块通常不足以在例如分类任务中达到高精度。因此,我们连续跳转到几个不同的位置(称为扫视),从而建立对整幅图像的理解。由于 log-polar 图像块包含全局上下文信息,我们可以仅使用小图像块高效地计算后续的扫视。扫视有效地弥补了 log-polar 变换缺乏平移等变性的不足。
引用
@article{arxiv.2005.05701,
title = {RetinotopicNet: An Iterative Attention Mechanism Using Local Descriptors with Global Context},
author = {Thomas Kurbiel and Shahrzad Khaleghian},
journal= {arXiv preprint arXiv:2005.05701},
year = {2020}
}
备注
7 pages, 23 figures