DLTPose:基于精确稠密表面点估计的 6DoF 姿态估计
计算机视觉与模式识别
2025-08-19 v2
摘要
我们提出 DLTPose,一种从 RGBD 图像进行 6DoF 物体姿态估计的新方法,它结合了稀疏关键点方法的准确性和稠密逐像素预测的鲁棒性。DLTPose 预测每个像素到一组至少四个关键点的径向距离,然后将其输入我们新颖的直接线性变换(DLT)公式,以生成精确的 3D 物体框架表面估计,从而实现更好的 6DoF 姿态估计。此外,我们引入了一种新颖的对称感知关键点排序方法,旨在处理物体对称性,否则会导致关键点分配不一致。以往基于关键点的方法依赖于固定的关键点顺序,未能考虑对称物体表现出的多种有效配置,而我们的排序方法利用这一点来增强模型学习稳定关键点表示的能力。在基准数据集 LINEMOD、Occlusion LINEMOD 和 YCB-Video 上的大量实验表明,DLTPose 优于现有方法,尤其对于对称和遮挡物体。代码可在 https://anonymous.4open.science/r/DLTPose_/ 获取。
引用
@article{arxiv.2504.07335,
title = {DLTPose: 6DoF Pose Estimation From Accurate Dense Surface Point Estimates},
author = {Akash Jadhav and Michael Greenspan},
journal= {arXiv preprint arXiv:2504.07335},
year = {2025}
}
备注
made changes to the evaluation, and added a few required ablation studies