中文

MOTPose:基于注意力时序融合的动态视频序列多目标6D姿态估计

机器人学 2026-02-02 v1

摘要

在拥挤的 bin Picking 环境中,姿态估计模型面临挑战。尽管深度学习取得了显著进展,但单视角RGB姿态估计模型在拥挤的动态环境中表现不佳。将场景视频中所包含的丰富时序信息融入模型中,有望增强其处理遮挡和环境动态性质的能力。此外,联合目标检测与姿态估计模型更适合利用两项任务之间的相互依赖关系,以提高两项任务的准确性。为此,我们提出了一种基于注意力的时序融合方法,用于多目标6D姿态估计,通过累积视频序列多个帧的信息。我们的MOTPose方法以一系列图像作为输入,一次前向传播中完成所有物体的联合目标检测与姿态估计。它学习如何使用基于交叉注意力的融合模块在多个时间步骤上聚合物体嵌入和物体参数。我们在物理逼真的拥挤 bin 采购数据集 SynPick 以及 YCB-Video 数据集上进行评估,证明了该方法在姿态估计准确率和目标检测准确率方面的提升。

关键词

引用

@article{arxiv.2403.09309,
  title  = {MOTPose: Multi-object 6D Pose Estimation for Dynamic Video Sequences using Attention-based Temporal Fusion},
  author = {Arul Selvam Periyasamy and Sven Behnke},
  journal= {arXiv preprint arXiv:2403.09309},
  year   = {2026}
}