T6D-Direct:用于多目标6D位姿直接回归的Transformer
计算机视觉与模式识别
2021-09-24 v1
摘要
6D位姿估计是在给定输入图像中预测物体平移与朝向的任务,它是许多机器人与增强现实应用的关键前提。近来,配备多头自注意力机制的Transformer网络架构正崭露头角,在许多计算机视觉任务中取得最先进结果。基于Transformer的模型DETR将目标检测表述为集合预测问题,并在无需感兴趣区域池化、非极大抑制和边界框提议等标准组件的情况下取得了令人印象深刻的成果。在这项工作中,我们提出T6D-Direct,一种基于DETR构建的Transformer架构实时单阶段直接方法,用于执行6D多目标位姿直接估计。我们在YCB-Video数据集上评估了方法的性能。我们的方法实现了最快的推理时间,且位姿估计精度可与最先进方法相媲美。
引用
@article{arxiv.2109.10948,
title = {T6D-Direct: Transformers for Multi-Object 6D Pose Direct Regression},
author = {Arash Amini and Arul Selvam Periyasamy and Sven Behnke},
journal= {arXiv preprint arXiv:2109.10948},
year = {2021}
}
备注
Accepted for DAGM German Conference on Pattern Recognition (GCPR), Bonn, Germany, September 2021