中文

VisionGRU:用于高效图像分析的线性复杂度RNN模型

计算机视觉与模式识别 2024-12-30 v2

摘要

卷积神经网络(CNNs)和视觉Transformer(ViTs)是图像分析中占主导地位的两种模型。虽然CNNs在提取多尺度特征方面表现出色,ViTs能够有效捕获全局依赖关系,但两者在处理高分辨率图像时都面临高计算成本的问题。最近,状态空间模型(SSMs)和循环神经网络(RNNs)因其效率受到关注。然而,它们在图像分类任务中的性能仍有限。为此,本文引入VisionGRU,一种专为高效图像分类设计的新型RNN架构。VisionGRU利用简化的门控循环单元(minGRU)以线性复杂度处理大规模图像特征。它将图像划分为更小的补丁,并在逐渐减小序列长度的同时增加通道深度,从而促进多尺度特征提取。层次化2DGRU模块采用双向扫描捕获局部和全局上下文,提高了长程依赖建模,尤其适用于语义分割等任务。在ImageNet和ADE20K数据集上的实验结果表明,VisionGRU超越了ViTs,显著降低了内存使用和计算成本,尤其在处理高分辨率图像时效果更为显著。这些发现凸显了基于RNN的方法在开发高效和可扩展计算机视觉解决方案方面的潜力。代码将在https://github.com/YangLiu9208/VisionGRU上提供。

关键词

引用

@article{arxiv.2412.18178,
  title  = {VisionGRU: A Linear-Complexity RNN Model for Efficient Image Analysis},
  author = {Shicheng Yin and Kaixuan Yin and Weixing Chen and Enbo Huang and Yang Liu},
  journal= {arXiv preprint arXiv:2412.18178},
  year   = {2024}
}

备注

Codes will be available at https://github.com/YangLiu9208/VisionGRU