基于Transformer的视频物体6D位姿估计
计算机视觉与模式识别
2023-09-06 v2 人工智能
人机交互
机器学习
机器人学
摘要
我们介绍了一种基于Transformer的6D物体位姿估计框架VideoPose,其包含端到端的基于注意力的建模架构,该架构关注先前帧以估计视频中准确的6D物体位姿。我们的方法利用视频序列的时间信息来进行位姿细化,同时具有计算高效和鲁棒性。与现有方法相比,我们的架构能够高效捕获并推理长程依赖,从而 over 视频序列迭代细化。在YCB-Video数据集上的实验评估表明,我们的方法与最先进的Transformer方法相当,并且相对于基于CNN的方法表现显著更好。此外,其速度为33 fps,也更高效,因此适用于需要实时物体位姿估计的多种应用。训练代码和预训练模型可在 https://github.com/ApoorvaBeedu/VideoPose 获取。
引用
@article{arxiv.2210.13540,
title = {Video based Object 6D Pose Estimation using Transformers},
author = {Apoorva Beedu and Huda Alamri and Irfan Essa},
journal= {arXiv preprint arXiv:2210.13540},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2111.10677