中文

Gated-SwinRMT:通过输入依赖门控统一 Swin 窗口注意力与 Retentive Manhattan 衰减

机器学习 2026-04-13 v2

摘要

我们引入了 Gated-SwinRMT,一个混合视觉 Transformer 家族,将 Swin Transformer 的移位窗口注意力与 Retentive Networks(RMT)的 Manhattan 距离空间衰减相结合,并辅以输入依赖门控。自注意力被分解为每个移位窗口内的连续宽度方向和高度方向保留传递,其中每个头的指数衰减掩码提供了二维局部先验,而无需学习的位置偏置。提出了两个变体。Gated-SwinRMT-SWAT 用 sigmoid 激活替代 softmax,实现平衡的 ALiBi 斜率与乘法后激活空间衰减,并通过 SwiGLU 门控值投影;归一化输出隐式抑制了无信息注意力分数。Gated-SwinRMT-Retention 保留了 softmax 归一化的保留,并加入加性的对数空间衰减偏差,同时包含一个显式的 G1 sigmoid 门控——从块输入投影并在局部上下文增强(LCE)之后但在输出投影 WOW_O 之前应用——以缓解低秩 WV ⁣ ⁣WOW_V \!\cdot\! W_O 瓶颈并实现对已关注输出的输入依赖抑制。我们在 Mini-ImageNet(224×224224{\times}224,100 类)和 CIFAR-10(32×3232{\times}32,10 类)上以相同训练协议评估了两个变体,由于资源限制仅使用单个 GPU。在约 77-79M 参数下,Gated-SwinRMT-SWAT 在 Mini-ImageNet 上达到 80.22% 的 top-1 测试准确率,Gated-SwinRMT-Retention 达到 78.20%,而 RMT 基线为 73.74%。在 CIFAR-10 上——其中小特征图导致自适应窗口机制将注意力坍缩为全局范围——准确率优势从 +6.48 pp 压缩到 +0.56 pp。

关键词

引用

@article{arxiv.2604.06014,
  title  = {Gated-SwinRMT: Unifying Swin Windowed Attention with Retentive Manhattan Decay via Input-Dependent Gating},
  author = {Dipan Maity and Suman Mondal and Arindam Roy},
  journal= {arXiv preprint arXiv:2604.06014},
  year   = {2026}
}