使用多分辨率可变形注意力和查询聚合的高效多目标姿态估计
计算机视觉与模式识别
2023-12-14 v1
摘要
目标姿态估计是计算机视觉中的一个长期问题。近年来,基于注意力的视觉Transformer模型在许多计算机视觉应用中取得了最先进的结果。利用注意力机制的排列不变性,一系列视觉Transformer模型将多目标姿态估计表述为一个集合预测问题。然而,现有的用于多目标姿态估计的视觉Transformer模型完全依赖于注意力机制。另一方面,卷积神经网络将各种归纳偏置硬编码到其架构中。在本文中,我们研究了在用于多目标姿态估计的视觉Transformer模型中融入归纳偏置,这有助于学习长程依赖关系,同时避免了代价高昂的全局注意力。具体而言,我们使用了多分辨率可变形注意力,其中注意力操作仅在少数变形参考点之间执行。此外,我们提出了一种查询聚合机制,使得在不增加计算复杂度的情况下增加目标查询的数量。我们在具有挑战性的YCB-Video数据集上评估了所提出的模型,并报告了最先进的结果。
引用
@article{arxiv.2312.08268,
title = {Efficient Multi-Object Pose Estimation using Multi-Resolution Deformable Attention and Query Aggregation},
author = {Arul Selvam Periyasamy and Vladimir Tsaturyan and Sven Behnke},
journal= {arXiv preprint arXiv:2312.08268},
year = {2023}
}
备注
IEEE International Conference on Robotic Computing (IRC), Laguna Hills, USA, December 2023