基于监督跨模态特征匹配的单帧点-像素配准
计算机视觉与模式识别
2025-07-01 v1 人工智能
机器人学
摘要
LiDAR 点云与摄像机图像之间的点-像素配准是自动驾驶和机器人感知中的一个基本而具有挑战性的任务。其关键难点在于,在稀疏的单帧 LiDAR 场景下,结构化图像与非结构化点云之间的模态差距。现有方法通常独立提取点云和图像特征,然后依赖手工设计或学习型匹配策略。这种分离编码无法有效桥接模态差距,更关键的是,这些方法在处理单帧 LiDAR 的稀疏性和噪声时常常不堪一击,往往需要点云累积或额外的先验条件来提高可靠性。灵感来自最近在无检测器匹配范式(如 MatchAnything)方面的进展,我们重新审视基于投影的方法,引入无检测器框架,以实现 LiDAR 视图与摄像机视图之间的直接点-像素匹配。具体而言,我们将 LiDAR 激光强度图从 LiDAR 视角投影为 2D 视图,并输入基于注意力机制的无检测器匹配网络,实现无需依赖多帧累积的跨模态对应估计。为进一步提升匹配可靠性,我们引入重复性评分机制,作为软可见性先验,引导网络抑制在强度变化较小的区域中不可靠的匹配,从而提高稀疏输入下的鲁棒性。在 KITTI、nuScenes 和 MIAS-LCEC-TF70 数据集上的大量实验表明,我们的方法在性能上实现了最先进水平,即使只使用单帧 LiDAR,也在 nuScenes 上超越了先前的方法(包括依赖点云累积的方法)。
引用
@article{arxiv.2506.22784,
title = {Single-Frame Point-Pixel Registration via Supervised Cross-Modal Feature Matching},
author = {Yu Han and Zhiwei Huang and Yanting Zhang and Fangjun Ding and Shen Cai and Rui Fan},
journal= {arXiv preprint arXiv:2506.22784},
year = {2025}
}