中文

PViT-6D:通过置信度预测与位姿令牌为视觉Transformer超频以实现6D位姿估计

计算机视觉与模式识别 2023-11-30 v1

摘要

在当前6D位姿估计领域,性能最优的技术依赖于复杂的中间对应、专用架构以及非端到端算法。相比之下,我们的研究通过将问题重构为一个直接的回归任务,探索视觉Transformer通过定制使用分类令牌进行直接6D位姿估计的能力。我们还引入了一种确定位姿置信度的简单方法,该方法可轻松集成到大多数6D位姿估计框架中。这涉及根据网络对场景复杂度的评估减少查询元素的数量来修改Transformer架构。我们称之为位姿视觉Transformer(Pose Vision Transformer)或PViT-6D的方法具有实现简单和端到端可学习的优点,同时在Linemod-Occlusion上以+0.3% ADD(-S)和在YCB-V数据集上以+2.7% ADD(-S)优于当前最先进的方法。此外,我们的方法增强了模型的可解释性以及推理时性能表现的可靠性。

关键词

引用

@article{arxiv.2311.17504,
  title  = {PViT-6D: Overclocking Vision Transformers for 6D Pose Estimation with Confidence-Level Prediction and Pose Tokens},
  author = {Sebastian Stapf and Tobias Bauernfeind and Marco Riboldi},
  journal= {arXiv preprint arXiv:2311.17504},
  year   = {2023}
}