增强深度神经网络中的小目标编码:引入带有体积点积层的 Fast&Focused-Net
计算机视觉与模式识别
2024-01-19 v1
摘要
本文介绍了 Fast&Focused-Net,这是一种专为将小目标高效编码为固定长度特征向量而设计的新型深度神经网络架构。与传统的卷积神经网络(CNN)不同,Fast&Focused-Net 采用了一系列我们新提出的层,即体积点积(VDP)层,旨在解决 CNN 的几个固有局限性。具体而言,CNN 的有效感受野往往小于其理论值,限制了其视野范围。此外,CNN 的初始层产生低维特征向量,为后续学习造成了瓶颈。最后,CNN 的计算开销,特别是在通过参数共享捕捉多样图像区域方面,显著较高。作为 Fast&Focused-Net 核心的 VDP 层,旨在以降低的计算需求高效覆盖整个图像块信息来补救这些问题。实验结果证明了 Fast&Focused-Net 在各种应用中的卓越能力。在小目标分类任务中,我们的网络在 CIFAR-10、CIFAR-100、STL-10、SVHN-Cropped 和 Fashion-MNIST 等数据集上优于最先进的方法。在更大图像分类的背景下,当与 Transformer 编码器(ViT)结合时,Fast&Focused-Net 在 OpenImages V6、ImageNet-1K 和 Places365 数据集上产生了具有竞争力的结果。此外,同样的组合在 SVT、IC15、SVTP 和 HOST 数据集上的文本识别任务中展示了无与伦比的性能。本文展示了该架构、其背后的动机以及大量实证证据,表明 Fast&Focused-Net 是高效且专注的深度学习的一个有前景的方向。
引用
@article{arxiv.2401.09823,
title = {Enhancing Small Object Encoding in Deep Neural Networks: Introducing Fast&Focused-Net with Volume-wise Dot Product Layer},
author = {Ali Tofik and Roy Partha Pratim},
journal= {arXiv preprint arXiv:2401.09823},
year = {2024}
}