RSRWKV:面向遥感视觉任务的线性复杂度 2D 注意力机制
计算机视觉与模式识别
2025-03-27 v1
摘要
高分辨率遥感分析面临由于场景复杂性和尺度多样性导致的全局上下文建模挑战。虽然 CNN 通过参数共享在局部特征提取方面表现出色,但其固定的感受野从根本上限制了长程依赖的建模。视觉 Transformer(ViT)通过自注意力机制有效捕获全局语义关系,但相对于图像分辨率具有二次计算复杂度,为高分辨率图像创建了关键效率瓶颈。RWKV 模型在 NLP 中实现了线性复杂度序列建模的突破,但由于其 1D 扫描机制,在视觉任务中表现出各向异性局限。为此,我们提出了 RSRWKV,特别设计了 2D-WKV 扫描机制,将顺序处理与 2D 空间推理相结合,同时保持线性复杂度,实现多方向各向同性的上下文聚合。MVC-Shift 模块增强了多尺度感受野覆盖,ECA 模块强化了跨通道特征交互与语义显著性建模。实验结果表明,RSRWKV 在 NWPU RESISC45、VHR-10.v2 和 GLH-Water 数据集上的分类、检测和分割任务中优于 CNN 和 Transformer 框架基线,为高分辨率遥感分析提供了可扩展的解决方案。
引用
@article{arxiv.2503.20382,
title = {RSRWKV: A Linear-Complexity 2D Attention Mechanism for Efficient Remote Sensing Vision Task},
author = {Chunshan Li and Rong Wang and Xiaofei Yang and Dianhui Chu},
journal= {arXiv preprint arXiv:2503.20382},
year = {2025}
}