中文

基于多粒度感知的语义原型扫描与三 Token 提示学习驱动的高阶 RWKV 用于图像锐化

计算机视觉与模式识别 2026-04-17 v1

摘要

本工作提出一种基于高阶 RWKV 架构和源自语义聚类的三 Token 提示机制的多粒度感知语义原型扫描范式,用于图像锐化。具体而言,本方法包含三个关键组件:1) 多粒度感知语义原型扫描。虽然 RWKV 提供了对 Transformer 的高效线性复杂度替代方案,但其传统的双向栅格扫描仍然是语义不可知的,且容易受位置偏差影响。为解决此问题,我们引入语义驱动的扫描策略,利用局部敏感哈希将语义相关区域分组并构建多粒度语义原型,从而实现上下文感知的 token 重排序和更连贯的全局交互。2) 三 Token 提示学习。我们设计由全局 token、聚类派生的原型 token 和可学习的寄存器 token 组成的三 Token 提示机制。全局 token 和原型 token 为 RWKV 建模提供互补的语义先验,而寄存器 token 有助于抑制噪声和易产生伪影的中间表示。3) 可逆 Q-Shift。为抵消空间细节,我们在值路径上应用中心差分卷积以注入高频信息,并引入可逆多尺度 Q-Shift 操作,以无需参数密集的感受野扩张的方式实现高效且无损的特征转换。实验结果表明,我们方法的优越性。

关键词

引用

@article{arxiv.2604.14622,
  title  = {Multigrain-aware Semantic Prototype Scanning and Tri-Token Prompt Learning Embraced High-Order RWKV for Pan-Sharpening},
  author = {Junfeng Li and Wenyang Zhou and Xueheng Li and Xuanhua He and Jianhou Gan and Wenqi Ren},
  journal= {arXiv preprint arXiv:2604.14622},
  year   = {2026}
}