中文

基于Transformer的视频物体6D位姿估计

计算机视觉与模式识别 2023-09-06 v2 人工智能 人机交互 机器学习 机器人学

摘要

我们介绍了一种基于Transformer的6D物体位姿估计框架VideoPose,其包含端到端的基于注意力的建模架构,该架构关注先前帧以估计视频中准确的6D物体位姿。我们的方法利用视频序列的时间信息来进行位姿细化,同时具有计算高效和鲁棒性。与现有方法相比,我们的架构能够高效捕获并推理长程依赖,从而 over 视频序列迭代细化。在YCB-Video数据集上的实验评估表明,我们的方法与最先进的Transformer方法相当,并且相对于基于CNN的方法表现显著更好。此外,其速度为33 fps,也更高效,因此适用于需要实时物体位姿估计的多种应用。训练代码和预训练模型可在 https://github.com/ApoorvaBeedu/VideoPose 获取。

关键词

引用

@article{arxiv.2210.13540,
  title  = {Video based Object 6D Pose Estimation using Transformers},
  author = {Apoorva Beedu and Huda Alamri and Irfan Essa},
  journal= {arXiv preprint arXiv:2210.13540},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2111.10677