中文

OneViewAll:面向新物体的语义先验引导单视图 6D 位姿估计

计算机视觉与模式识别 2026-05-11 v1

摘要

在许多实际的 6D 物体位姿估计场景中,每个物体通常只能获取单张真实世界 RGB-D 参考视图,且往往没有 CAD 模型。现有方法主要依赖显式 3D 模型或多视图数据,这限制了其可扩展性。为应对这一具有挑战性的单参考无模型设定,我们提出了 \textbf{OneViewAll},一个语义先验引导的框架,通过一种新颖的投影与比较 (Project-and-Compare) 范式执行位姿估计。我们的方法不依赖计算昂贵的基于 CAD 的渲染,而是直接在投影等变空间内对齐参考视图和查询视图的观测。OneViewAll 在三个层级上逐步整合分层语义先验:(1) \textit{类别级和场景级}先验,用于高效的假设初始化;(2) \textit{物体级对称性}先验,用于通过镜像融合进行几何补全;(3) \textit{图像块级}先验,用于判别性细化。大量实验表明,OneViewAll 仅使用一个真实参考视图就在 LINEMOD 数据集上实现了 \textbf{92.5\%} 的 ADD-0.1 准确率——显著优于 CVPR 2025 基线方法 One2Any (52.6\%)。它还在 YCB-V、Real275 和 Toyota-Light 上取得了一致的提升,同时保持了较低的推理延迟。我们的结果凸显了对称感知投影在处理对称、无纹理和遮挡物体方面的有效性。

关键词

引用

@article{arxiv.2605.07023,
  title  = {OneViewAll: Semantic Prior Guided One-View 6D Pose Estimation for Novel Objects},
  author = {Yang Luo and Yan Gong and Yongsheng Gao and Jie Zhao and Xinyu Zhang and Huaping Liu},
  journal= {arXiv preprint arXiv:2605.07023},
  year   = {2026}
}