视觉鹰眼注意力:推进图像分类的新视角
计算机视觉与模式识别
2024-12-10 v2 人工智能
摘要
在计算机视觉任务中,聚焦于图像内相关区域的能力对提升模型性能至关重要,特别是当关键特征微小、细微或空间分散时。卷积神经网络(CNN)通常同等对待图像的所有区域,这可能导致特征提取效率低下。为应对这一挑战,我提出了视觉鹰眼注意力,一种利用卷积空间注意力增强视觉特征提取的新型注意力机制。该模型应用卷积捕捉局部空间特征,并生成注意力图,选择性地强调图像中最有信息量的区域。这种注意力机制使模型能够聚焦于判别性特征,同时抑制无关背景信息。我将视觉鹰眼注意力集成到轻量级 ResNet-18 架构中,证明该组合产生了一个高效且强大的模型。我在三个广泛使用的基准数据集上评估了所提模型的性能:FashionMNIST、Intel 图像分类和 OracleMNIST,主要关注图像分类。实验结果表明,所提方法提高了分类准确率。此外,该方法有潜力扩展到其他视觉任务,如目标检测、分割和视觉跟踪,为广泛的基于视觉的应用提供计算高效的解决方案。代码可在以下地址获取:https://github.com/MahmudulHasan11085/Vision-Eagle-Attention.git
引用
@article{arxiv.2411.10564,
title = {Vision Eagle Attention: a new lens for advancing image classification},
author = {Mahmudul Hasan},
journal= {arXiv preprint arXiv:2411.10564},
year = {2024}
}
备注
7 pages, 2 figures, 3 tables