SingRef6D:基于单张 RGB 参考图像的单目新物体位姿估计
计算机视觉与模式识别
2025-09-29 v1
摘要
近期的 6D 位姿估计方法展现了显著的性能,但仍然面临一些实际限制。例如,其中许多方法严重依赖传感器深度,这在具有挑战性的表面条件下(如透明或高反射材料)可能会失效。同时,由于缺乏几何信息,基于 RGB 的解决方案在低光和无纹理场景下提供的匹配性能较差。受此启发,我们提出了 SingRef6D,这是一个仅需单张 RGB 图像作为参考的轻量级流程,无需昂贵的深度传感器、多视图图像采集或训练视图合成模型和神经场。这使得 SingRef6D 在深度或密集模板不可用的资源受限环境下仍能保持稳健且有效。我们的框架包含两项关键创新。首先,我们提出了一种基于 token 缩放器的微调机制,并在 Depth-Anything v2 之上引入了新的优化损失,以增强其预测准确深度的能力,即使对于具有挑战性的表面也是如此。我们的结果显示,与 Depth-Anything v2(带有微调头)相比,在 REAL275 深度预测上取得了 14.41% 的提升(在 中)。其次,得益于深度的可用性,我们引入了深度感知匹配过程,该过程有效地整合了 LoFTR 内的空间关系,使我们的系统能够处理具有挑战性的材料和光照条件下的匹配。在 REAL275、ClearPose 和 Toyota-Light 数据集上的位姿估计评估表明,我们的方法超越了现有最先进的方法,平均召回率提升了 6.1%。
引用
@article{arxiv.2509.21927,
title = {SingRef6D: Monocular Novel Object Pose Estimation with a Single RGB Reference},
author = {Jiahui Wang and Haiyue Zhu and Haoren Guo and Abdullah Al Mamun and Cheng Xiang and Tong Heng Lee},
journal= {arXiv preprint arXiv:2509.21927},
year = {2025}
}
备注
Accepted as a poster in NeurIPS 2025