YOLOPose V2:理解并改进基于 Transformer 的 6D 姿态估计
计算机视觉与模式识别
2023-07-24 v1
摘要
6D 物体姿态估计是自主机器人操作应用的关键前提。最先进的姿态估计模型是基于卷积神经网络(CNN)的。近来,最初为自然语言处理提出的 Transformer 架构也在许多计算机视觉任务中取得了最先进的结果。借助多头自注意力机制,Transformer 实现了简单的单阶段端到端架构,用于联合学习物体检测和 6D 物体姿态估计。在这项工作中,我们提出 YOLOPose(You Only Look Once Pose estimation 的简称),一种基于 Transformer 的多物体 6D 姿态估计方法,基于关键点回归以及 YOLOPose 模型的改进变体。与预测图像中关键点的标准热图不同,我们直接回归关键点。此外,我们采用可学习的方向估计模块从关键点预测方向。连同独立的平移估计模块,我们的模型是端到端可微的。我们的方法适用于实时应用,并取得了与最先进方法可比的结果。我们分析了物体查询在我们架构中的作用,并揭示物体查询专门检测特定图像区域中的物体。此外,我们量化了使用较小规模数据集训练我们模型时的精度权衡。
引用
@article{arxiv.2307.11550,
title = {YOLOPose V2: Understanding and Improving Transformer-based 6D Pose Estimation},
author = {Arul Selvam Periyasamy and Arash Amini and Vladimir Tsaturyan and Sven Behnke},
journal= {arXiv preprint arXiv:2307.11550},
year = {2023}
}
备注
Robotics and Autonomous Systems Journal, Elsevier, to appear 2023. arXiv admin note: substantial text overlap with arXiv:2205.02536