中文

TransPoser:将 Transformer 作为联合物体形状与位姿估计的优化器

计算机视觉与模式识别 2023-03-24 v1

摘要

我们提出一种从顺序观测的 RGB-D 图像中联合估计刚体物体形状与位姿的新方法。与以往依赖复杂非线性优化的方法截然不同,我们将其表述为神经优化,学习高效估计形状与位姿。我们引入深度方向距离函数(DeepDDF),一个给定相机视点与视线方向即直接输出物体深度图像的神经网络,用于在 2D 图像空间高效计算误差。我们将联合估计本身表述为一个我们称之为 TransPoser 的 Transformer。我们充分利用分词与多头注意力,分别顺序处理不断增长的观测集合,并以学习到的动量高效更新形状与位姿。在合成与真实数据上的实验结果表明,DeepDDF 作为类别级物体形状表征达到高准确度,且 TransPoser 在联合形状与位姿估计上高效达到最先进的准确度。

关键词

引用

@article{arxiv.2303.13477,
  title  = {TransPoser: Transformer as an Optimizer for Joint Object Shape and Pose Estimation},
  author = {Yuta Yoshitake and Mai Nishimura and Shohei Nobuhara and Ko Nishino},
  journal= {arXiv preprint arXiv:2303.13477},
  year   = {2023}
}