中文

GPU 驻留确定性 SIFT:用于深度学习视觉管线

计算机视觉与模式识别 2026-05-19 v1

摘要

局部特征研究中的一个广泛假设是,经典手工描述子因准确率有限而应被学习型替代方案取代。我们证明了这一假设是错误的。通过进行跨越四个基准数据集(HPatches、ROxford5K、IMC Phototourism、MegaDepth)的 8 项配置消除实验,我们展示经典 SIFT 配合 DSP 多尺度池化在每个准确度指标上均优于神经描述器和方向替换方案(HardNet、OriNet),同时运行速度快 2--18 倍,学习型匹配器(LightGlue)是 complement 而非取代经典特征。此结论重新阐释了一个十年的工作:不是 "取代 SIFT",而是 "与 SIFT 组合",经典提取配合学习匹配仅在几何上下文需要时才使用。这种发现过去无法被察觉,因为没有任何 GPU SIFT 能保持完整管线在 VRAM 中,或提供模块化进行经典与学习消除实验的能力。我们提出 PySIFT,首个完全 GPU 驻留 SIFT,采用 CuPy/Numba CUDA 内核实现,采用 DLPack 零拷贝方式交接给下游深度学习框架——不论关键点数量, metadata 交换始终为亚毫秒 O(1)。在笔记本级 NVIDIA RTX 3050(4 GB VRAM)上,PySIFT 实现:(i) 在 HPatches 上高于 OpenCV SIFT 的平均匹配准确率(MMA),(ii) 在高分辨率 MegaDepth 上快 383 毫秒,(iii) 在跨数据集基准测试中获得更高几何准确率(+5.6 pp AUC@10{}^\circ on MegaDepth,IMC Phototourism 上 more inliers),以及(iv) 按位确定性输出——跨运行保持相同关键点和描述子,甚至跨 GPU 架构检测结果也完全一致:这是学习型提取器无法做到的,若要做到也需付出显著性能代价,甚至在 GPU 架构间无法做到,因为 cuDNN 的架构相关算法选择。PySIFT 开源,无需 C++ 编译。

关键词

引用

@article{arxiv.2605.17869,
  title  = {PySIFT: GPU-Resident Deterministic SIFT for Deep Learning Vision Pipelines},
  author = {Sivakumar K. S. and Mohammad Daniyalur Rahman and Gopi Raju Matta},
  journal= {arXiv preprint arXiv:2605.17869},
  year   = {2026}
}

备注

9 pages, 6 figures