中文

从有限数据学习估计六自由度位姿:一种基于 RGB 图像的少样本可泛化方法

计算机视觉与模式识别 2023-06-14 v1

摘要

六自由度(6DoF)物体位姿的准确估计对机器人与增强现实诸多应用至关重要。然而,现有 6DoF 位姿估计方法常依赖 CAD 模板或密集支持视图,限制了其在真实场景中的实用性。本研究提出一种称为 Cas6D 的新型级联框架,用于少样本、可泛化的 6DoF 位姿估计,且仅使用 RGB 图像。为应对极端少样本设定下目标物体检测的误检,我们的框架利用自监督预训练的 ViT 学习鲁棒特征表示。随后,基于相似度分数初始化最邻近的 top-K 位姿候选,并使用特征金字塔细化初始位姿,以构建并更新级联扭曲特征体,其在越来越精细的尺度上编码上下文。通过对位姿搜索范围进行多区间离散化,并利用前一阶段预测逐阶段缩小位姿搜索范围,Cas6D 能克服位姿候选与真实位姿间的大差距,而这是稀疏视图场景中的常见失效模式。在 LINEMOD 与 GenMOP 数据集上的实验结果表明,在 32-shot 设定下,相比 OnePose++ 与 Gen6D,Cas6D 的准确度(Proj-5)分别高出最先进方法 9.2% 与 3.8%。

关键词

引用

@article{arxiv.2306.07598,
  title  = {Learning to Estimate 6DoF Pose from Limited Data: A Few-Shot, Generalizable Approach using RGB Images},
  author = {Panwang Pan and Zhiwen Fan and Brandon Y. Feng and Peihao Wang and Chenxin Li and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2306.07598},
  year   = {2023}
}