FractalMamba++:通过 Hilbert 分形几何扩展视觉 Mamba 的分辨率规模性
计算机视觉与模式识别
2026-05-06 v4
摘要
视觉 Mamba 虽然具有处理长视觉序列的线性复杂度,但其性能严重依赖于二维补丁网格如何序列化为一维状态空间递推。光栅式扫描破坏了空间连续性,当推理分辨率超过训练网格时,2D 局部性与 1D 状态传播之间的不匹配问题日益严重。本文提出了 FractalMamba++,一种围绕希尔伯特曲线的递归自相似结构组织的分辨率可扩展视觉主干模型。首先,基于希尔伯特曲线的分形序列化更忠实地保留二维邻域,跨分辨率提供一致的邻域统计。其次,分形层级跳过连接 (FHSC) 从希尔伯特递归层级中推导出一套紧凑的确定性状态注入路径,无需运行时搜索、手工梯度或专用 CUDA 内核,缓解了长序列信息的衰减。最后,分形感知二维旋转位置编码 (FA-RoPE) 将归一化二维坐标与分形层级结合,使特征交互依赖于实际的空间邻近性和递归结构角色,而非序列化的一维距离。在 ImageNet-1K 分类、COCO 检测与实例分割、ADE20K 语义分割和 LEVIR-CD+ 遥感变化检测等大量实验中,FractalMamba++ 在 diverse 的页面级和元素级设置下均实现了最先进的性能,尤其在高分辨率输入下表现更为突出。
引用
@article{arxiv.2505.14062,
title = {FractalMamba++: Scaling Vision Mamba Across Resolutions via Hilbert Fractal Geometry},
author = {Bo Li and Haoke Xiao and Lv Tang},
journal= {arXiv preprint arXiv:2505.14062},
year = {2026}
}