D2S:以稀疏描述子与三维坐标表示实现相机重定位
计算机视觉与模式识别
2024-10-24 v4 机器人学
摘要
最先进的视觉定位方法大多依赖复杂流程来匹配局部描述子与三维点云。然而,这些流程在推理、存储及随时间更新方面会产生显著代价。在本研究中,我们提出一种直接的基于学习的方法,利用名为 D2S 的简易网络来表示复杂的局部描述子及其场景坐标。我们的方法以简洁与高性价比为特征。它在测试阶段仅使用单张 RGB 图像进行定位,且仅需轻量模型即可编码复杂稀疏场景。所提 D2S 结合简单损失函数与图注意力,选择性关注鲁棒描述子,同时忽略云、树木及若干动态物体区域。这种选择性注意力使 D2S 能对稀疏描述子有效执行二值语义分类。此外,我们提出一个简易室外数据集,以评估视觉定位方法在场景特定泛化及基于无标签观测自我更新方面的能力。我们的方法在室内与室外环境中均优于以往的基于回归的方法,展现出超越训练数据的泛化能力,包括昼到夜的转换及适应域偏移。源代码、训练模型、数据集与演示视频可见于以下链接:https://thpjp.github.io/d2s。
引用
@article{arxiv.2307.15250,
title = {D2S: Representing sparse descriptors and 3D coordinates for camera relocalization},
author = {Bach-Thuan Bui and Huy-Hoang Bui and Dinh-Tuan Tran and Joo-Ho Lee},
journal= {arXiv preprint arXiv:2307.15250},
year = {2024}
}
备注
Accepted to IEEE Robotics and Automation Letters