SceneGlue:无需场景级标注的场景感知Transformer特征匹配
计算机视觉与模式识别
2026-04-16 v1
摘要
局部特征匹配在理解跨视图图像对应关系方面发挥着关键作用。然而,传统方法受限于特征描述符的本质局部性,限制了其捕捉跨视图对应准确性所必需的非局部场景信息。在本文中,我们提出SceneGlue——一种旨在克服这些限制的场景感知特征匹配框架。SceneGlue利用可混合的匹配范式,集成隐式并行注意力与显式跨视图可见性估计。并行注意力机制在图像内部和跨图像之间同步交换局部描述符的信息,从而增强场景的全局上下文。为进一步丰富场景感知,本文提出可见性Transformer,其显式地将特征划分为可见与不可见区域,提供跨视图场景可见性的理解。通过结合显式与隐式的场景级感知,SceneGlue有效补偿了局部描述符的限制。值得注意的是,SceneGlue仅使用局部特征匹配进行训练,而无需场景级groundtruth标注。这种场景感知方法不仅在准确性和鲁棒性方面具有优势,还比传统方法具有更好的可解释性。在异方位估计、姿态估计、图像匹配和视觉定位等应用上进行了广泛实验,验证了SceneGlue的卓越性能。源代码已公开于https://github.com/songlin-du/SceneGlue。
引用
@article{arxiv.2604.13941,
title = {SceneGlue: Scene-Aware Transformer for Feature Matching without Scene-Level Annotation},
author = {Songlin Du and Xiaoyong Lu and Yaping Yan and Guobao Xiao and Xiaobo Lu and Takeshi Ikenaga},
journal= {arXiv preprint arXiv:2604.13941},
year = {2026}
}