基于关键点增强的单阶段单目 6D 姿态估计:Yolo-Key-6D
计算机视觉与模式识别
2026-03-05 v1
摘要
从单张 RGB 图像估计物体的 6D 姿态是机器人和扩展现实应用中的关键任务。然而,最先进的多阶段方法往往存在高延迟,不适用于实时使用。在本文中,我们提出了 Yolo-Key-6D,一种新颖的单阶段、端到端的框架,用于单目 6D 姿态估计,旨在兼顾速度和准确性。我们的做法通过集成一个回归物体 3D 边界框角点 2D 投影的辅助头来增强基于 YOLO 的架构。这一关键点检测任务显著提高了网络对 3D 几何的理解。为了实现稳定的端到端训练,我们直接回归使用通过奇异值分解投影到 SO(3) 的连续 9D 表示。 在 LINEMOD 和 LINEMOD-Occluded 基准测试上,Yolo-Key-6D 实现了 96.24% 和 69.41% 的竞争性准确率,分别以 ADD(-S) 0.1d 指标衡量,同时证明其能够实时运行。我们的结果表明,精心设计的单阶段方法可以为实际部署提供性能和效率之间的实用且有效的平衡。
引用
@article{arxiv.2603.03879,
title = {Yolo-Key-6D: Single Stage Monocular 6D Pose Estimation with Keypoint Enhancements},
author = {Kemal Alperen Çetiner and Hazım Kemal Ekenel},
journal= {arXiv preprint arXiv:2603.03879},
year = {2026}
}
备注
Accepted to VISAPP 2026