中文

OPFormer:基于几何编码的物体姿态估计

计算机视觉与模式识别 2025-11-18 v1 人工智能 机器学习 机器人学

摘要

我们引入了一个统一、端到端的框架,将物体检测和姿态估计无缝集成,并提供灵活的 onboard 过程。我们的管道以 onboard 阶段开始,从传统 3D CAD 模型或在其缺失时,通过快速从多视图图像重建高保真神经表示(NeRF)来生成物体表示。给定测试图像后,我们首先使用 CNOS 检测器定位目标物体。对于每个检测,我们的新型姿态估计模块 OPFormer 推断精确的 6D 姿态。OPFormer 的核心是基于 transformer 的架构,利用基础模型进行稳健的特征提取。它独特地通过联合编码多个模板视图并利用归一化物体坐标空间(NOCS)将这些特征丰富地与显式 3D 几何先验相结合。随后,解码器建立稳健的 2D-3D 对应关系,以确定最终姿态。在挑战性的 BOP 基准测试中,我们的集成系统在准确性和效率之间实现了强大的平衡,展示了其在 model-based 和 model-free 场景中的实际适用性。

关键词

引用

@article{arxiv.2511.12614,
  title  = {OPFormer: Object Pose Estimation leveraging foundation model with geometric encoding},
  author = {Artem Moroz and Vít Zeman and Martin Mikšík and Elizaveta Isianova and Miroslav David and Pavel Burget and Varun Burde},
  journal= {arXiv preprint arXiv:2511.12614},
  year   = {2025}
}