YOLOPose:基于Transformer利用关键点回归的多目标6D位姿估计
计算机视觉与模式识别
2022-05-06 v1
摘要
6D物体位姿估计是自主机器人操作应用的关键前提。最先进的位姿估计模型是基于卷积神经网络(CNN)的。近来,最初为自然语言处理提出的Transformer架构也在许多计算机视觉任务中取得了最先进的结果。借助多头自注意力机制,Transformer能够实现简单的单阶段端到端架构,用于联合学习目标检测与6D物体位姿估计。本工作中,我们提出YOLOPose(You Only Look Once Pose estimation的缩写),一种基于Transformer、利用关键点回归的多目标6D位姿估计方法。与预测图像中关键点的标准热图不同,我们直接回归关键点。此外,我们采用可学习的方向估计模块从关键点预测方向。结合独立的平移估计模块,我们的模型是端到端可微的。我们的方法适用于实时应用,并取得了与最先进方法相当的结果。
引用
@article{arxiv.2205.02536,
title = {YOLOPose: Transformer-based Multi-Object 6D Pose Estimation using Keypoint Regression},
author = {Arash Amini and Arul Selvam Periyasamy and Sven Behnke},
journal= {arXiv preprint arXiv:2205.02536},
year = {2022}
}