GlobalMamba:面向视觉Mamba的全局图像序列化
计算机视觉与模式识别
2024-10-15 v1
摘要
视觉Mamba通过对视觉token数量实现线性复杂度,展现了强大的性能。其效率来源于对图像token的顺序处理。然而,大多数现有方法采用基于patch的图像分词,然后展平为1D序列进行因果处理,忽略了图像固有的2D结构关联性;同时也难以通过对局部patch的顺序处理来提取全局信息。本文提出了全局图像序列化方法,用于将图像转换为包含2D图像全局信息的因果token序列。我们首先将图像从空间域转换到频域,使用离散余弦变换(DCT),然后按对应的频率范围排列像素。进一步将每个频率带内的像素集合变换回空间域,以获得分词前的一系列图像。我们构建了基于所提出的全局图像序列化方法的因果输入格式的视觉Mamba模型GlobalMamba,能够更好地利用图像序列之间的因果关系。广泛的实验表明,GlobalMamba在ImageNet-1K上的图像分类、COCO上的目标检测和ADE20K上的语义分割中均有效。
引用
@article{arxiv.2410.10316,
title = {GlobalMamba: Global Image Serialization for Vision Mamba},
author = {Chengkun Wang and Wenzhao Zheng and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2410.10316},
year = {2024}
}