中文

RAFNet:用于图像拼接的区域感知融合网络

机器学习 2026-05-05 v1

摘要

图像拼接旨在通过融合低分辨率多光谱 (LRMS) 和高分辨率色谱 (PAN) 图像生成高分辨率多光谱 (HRMS) 图像。尽管深度学习已推动该领域发展,但主流基于标准缩放点积注意力的频率方法面临二次计算复杂度,且未能利用遥感图像固有的区域稀疏性。此外,现有空间增强策略通常采用静态卷积核,难以适应 PAN 和 MS 图像的复杂频率和区域变化。为解决这些瓶颈,我们提出区域感知融合网络 (RAFNet),协同建模空间和频率信息。具体而言,我们设计了空间自适应细化 (SAR) 模块,利用离散小波变换 (DWT) 实现方向性频率分离,并采用 K-means 聚类实现区域划分,从而动态构建区域特定自适应卷积核,实现空间和频率自适应特征增强。此外,我们引入基于稀疏注意力机制的聚类频率聚合 (CFA) 模块,由语义聚类指导,执行区域感知稀疏注意力策略,显著降低计算冗余,同时确保高质量频率特征提取。我们还将这些模块集成到渐进的多层空间-频率网络架构中,以促进稳健的相互作用和精确的图像重构。广泛的在多个基准数据集上的实验表明,所提出的 RAFNet 在降低-和全分辨率评估方面均显著优于最先进的图像拼接方法。代码已公开:https://github.com/PatrickNod/RAFNet。

关键词

引用

@article{arxiv.2605.02183,
  title  = {Manifold-Constrained Adversarial Training for Long-Tailed Robustness via Geometric Alignment},
  author = {Guanmeng Xian and Ning Yang and Philip S. Yu},
  journal= {arXiv preprint arXiv:2605.02183},
  year   = {2026}
}

备注

Accepted by IJCAI 2026