DeepDetect:学习全要素密集关键点
计算机视觉与模式识别
2026-04-21 v4
摘要
关键点检测是许多计算机视觉任务的基础,包括图像注册、结构-from-motion、3D重建、视觉里程计和SLAM。传统检测器(SIFT, ORB, BRISK, FAST等)和基于学习的方法(SuperPoint, R2D2, QuadNet, LIFT等)均显示出强大的性能提升,却存在关键局限性:对光照变化敏感、关键点密度低且重复性差、难以适应挑战性场景,以及缺乏语义理解,常常无法优先考虑视觉上重要的区域。我们提出DeepDetect,一种智能、全要素、密集型检测器,通过深度学习统一了经典检测器的优势。首先,我们通过融合7个关键点检测器和2个边缘检测器的输出来创建地面实况掩码,从角落和斑点中提取多样化的视觉线索,以突出显示边缘和纹理。随后,训练一个轻量高效模型:ESPNet,使用融合掩码作为标签,使DeepDetect能够在图像上进行语义聚焦,同时产生高度密集的关键点,这些关键点能够适应多样化且视觉上受损的条件。在Oxford、HPatches和Middlebury数据集上的评估表明,DeepDetect在其他检测器中取得了最高值:0.5143(平均关键点密度)、0.9582(平均重复性)、338,118(正确匹配)和842,045(立体3D重建中的体素)。
引用
@article{arxiv.2510.17422,
title = {DeepDetect: Learning All-in-One Dense Keypoints},
author = {Shaharyar Ahmed Khan Tareen and Filza Khan Tareen and Xiaojing Yuan},
journal= {arXiv preprint arXiv:2510.17422},
year = {2026}
}
备注
8 pages, 8 figures, 3 tables, 6 equations