中文

YOPO:一种用于单目RGB类别级9D多目标姿态估计的极简检测Transformer

计算机视觉与模式识别 2026-03-11 v3 机器人学

摘要

从单张RGB图像中精确恢复特定类别内未见实例的完整9自由度姿态,仍然是机器人与自动化领域的核心挑战。现有大多数解决方案仍依赖伪深度、CAD模型或多级级联,将二维检测与姿态估计分离。受对一种更简单、仅使用RGB且直接在类别层面学习的替代方案的需求驱动,我们重新审视一个长期存在的问题:能否在不依赖任何额外数据的情况下,将目标检测与9自由度姿态估计统一起来并实现高性能?我们证明,通过我们的方法YOPO可以实现这一点。YOPO是一个单阶段、基于查询的框架,它将类别级9自由度估计视为二维检测的自然延伸。YOPO用一个轻量级姿态头、一个边界框条件平移模块以及一个6D感知的匈牙利匹配代价来增强Transformer检测器。该模型仅使用RGB图像和类别级姿态标签进行端到端训练。尽管设计极简,YOPO在三个基准测试上均设立了新的最优水平。在REAL275数据集上,它达到了79.6%的IoU50\rm{IoU}_{50},并在1010^\circ10cm10{\rm{cm}}指标下达到54.1%,超越了先前的纯RGB方法,并大幅缩小了与RGB-D系统的差距。代码、模型和额外的定性结果可在https://mikigom.github.io/YOPO-project-page找到。

关键词

引用

@article{arxiv.2508.14965,
  title  = {You Only Pose Once: A Minimalist's Detection Transformer for Monocular RGB Category-level 9D Multi-Object Pose Estimation},
  author = {Hakjin Lee and Junghoon Seo and Jaehoon Sim},
  journal= {arXiv preprint arXiv:2508.14965},
  year   = {2026}
}

备注

This paper has been accepted by IEEE ICRA 2026