基于加权向量式关键点投票的深度融合 Transformer 网络用于鲁棒 6D 物体位姿估计
计算机视觉与模式识别
2023-08-11 v1
摘要
从单张 RGBD 图像进行 6D 物体位姿估计的一个关键挑战是有效整合两种不同模态,即颜色和深度。在本工作中,我们通过一种新颖的深度融合 Transformer (DFTr) 模块来解决此问题,该模块能够聚合跨模态特征以改进位姿估计。与现有融合方法不同,所提出的 DFTr 可通过利用颜色与深度模态的语义相似性更好地建模跨模态语义关联,从而更好地整合来自不同模态的全局增强特征以改进信息提取。此外,为了进一步提高鲁棒性和效率,我们引入了一种新颖的加权向量式投票算法,该算法采用非迭代全局优化策略进行精确的 3D 关键点定位,同时实现近实时推理。大量实验表明了我们所提出的 3D 关键点投票算法的有效性和强泛化能力。在四个广泛使用基准上的结果也表明,我们的方法大幅优于 SOTA 方法。
引用
@article{arxiv.2308.05438,
title = {Deep Fusion Transformer Network with Weighted Vector-Wise Keypoints Voting for Robust 6D Object Pose Estimation},
author = {Jun Zhou and Kai Chen and Linlin Xu and Qi Dou and Jing Qin},
journal= {arXiv preprint arXiv:2308.05438},
year = {2023}
}
备注
Accepted by ICCV2023