XPoint:一种基于视觉状态空间的自监督多光谱图像配准架构
计算机视觉与模式识别
2026-03-03 v1
摘要
由于跨光谱模态的非线性强度变化、极端视角变化以及标注数据集的稀缺,精确的多光谱图像匹配面临重大挑战。当前最先进的方法通常针对单一光谱差异(如可见光-红外)进行专门设计,因依赖深度图或相机位姿等昂贵监督而难以适应其他模态。为满足跨模态快速适应的需求,我们提出XPoint,一种自监督的模块化图像匹配框架,专为在对齐的多光谱数据集上进行自适应训练和微调而设计,允许用户根据特定任务自定义关键组件。XPoint利用模块化和自监督,允许调整基础检测器等元素,该检测器生成对视角和光谱变化不变的伪真值关键点。框架集成了在分割任务上预训练的VMamba编码器以实现鲁棒特征提取,并包含三个联合解码头:两个专门用于关键点和描述子提取;一个任务特定的单应性回归头施加几何约束,以在图像配准等任务中获得卓越性能。这种灵活架构能快速适应广泛模态,通过在光学-热成像数据上训练并在可见光-近红外、可见光-红外、可见光-长波红外和可见光-合成孔径雷达等设置上微调加以证明。实验结果表明,XPoint在五个不同的多光谱数据集上的特征匹配和图像配准任务中持续优于或匹配最先进方法。我们的源代码可在https://github.com/canyagmur/XPoint获取。
引用
@article{arxiv.2411.07430,
title = {XPoint: A Self-Supervised Visual-State-Space based Architecture for Multispectral Image Registration},
author = {Ismail Can Yagmur and Hasan F. Ates and Bahadir K. Gunturk},
journal= {arXiv preprint arXiv:2411.07430},
year = {2026}
}
备注
13 pages, 11 figures, 1 table, Journal