深度学习中的视觉注意力方法:一项深度综述
计算机视觉与模式识别
2024-05-07 v3 人工智能
机器学习
图像与视频处理
摘要
受人类认知系统启发,注意力是一种模仿人类认知对特定信息觉知机制的机制,它放大关键细节以更聚焦于数据本质方面。深度学习已采用注意力来提升诸多应用的性能。有趣的是,同一注意力设计可适用于处理不同数据模态,并易于嵌入大型网络。此外,多种互补注意力机制可纳入同一网络。因此,注意力技术极具吸引力。然而,文献缺乏关于注意力技术的全面综述以指导研究者在深度模型中运用注意力。需注意,除对训练数据与计算资源要求高之外,transformers仅涵盖众多类别中自注意力的单一类别。我们填补此空白,对50种注意力技术进行深度综述,按其最显著特征分类。我们首先介绍注意力机制成功背后的基本概念。接着,给出诸如各类注意力的优势与局限等要点,描述其基本构建模块、基本公式与主要用途,以及特别针对计算机视觉的应用。我们还讨论与注意力机制相关的挑战与一般性开放问题。最后,推荐深度注意力的未来研究方向。有关深度学习中视觉注意力方法的所有信息均提供于\href{https://github.com/saeed-anwar/VisualAttention}{https://github.com/saeed-anwar/VisualAttention}
引用
@article{arxiv.2204.07756,
title = {Visual Attention Methods in Deep Learning: An In-Depth Survey},
author = {Mohammed Hassanin and Saeed Anwar and Ibrahim Radwan and Fahad S Khan and Ajmal Mian},
journal= {arXiv preprint arXiv:2204.07756},
year = {2024}
}
备注
Accepted in Information Fusion