SCOPE:用于机器人 Sim2Real 类别级物体位姿估计的语义条件化方法
计算机视觉与模式识别
2025-09-30 v1 机器人学
摘要
物体操控需要精确的物体位姿估计。在开放环境中,机器人会遇到未知物体,这需要语义理解以泛化到已知类别乃至未知类别。为解决这一挑战,我们提出了 SCOPE,一种基于扩散的类别级物体位姿估计模型,通过利用 DINOv2 特征作为连续语义先验来消除对离散类别标签的需求。将这些 DINOv2 特征与照片级真实训练数据和点法线噪声模型相结合,我们缩小了类别级物体位姿估计中的 Sim2Real 差距。此外,通过交叉注意力注入连续语义先验,SCOPE 能够学习已知类别分布之外各物体实例的标准化物体坐标系。SCOPE 在合成训练的类别级物体位姿估计上超越了当前最先进方法,在 5°5cm 指标上实现了相对提升 31.9%。在两个实例级数据集上的额外实验展示了超越已知物体类别的泛化能力,实现了对未知类别物体的抓取成功率高达 100%。代码地址:https://github.com/hoenigpeter/scope。
引用
@article{arxiv.2509.24572,
title = {SCOPE: Semantic Conditioning for Sim2Real Category-Level Object Pose Estimation in Robotics},
author = {Peter Hönig and Stefan Thalhammer and Jean-Baptiste Weibel and Matthias Hirschmanner and Markus Vincze},
journal= {arXiv preprint arXiv:2509.24572},
year = {2025}
}