WALDO:面向遮挡的无见模型基6D姿态估计
计算机视觉与模式识别
2025-11-21 v1 人工智能
机器学习
摘要
准确的6D物体姿态估计对机器人、增强现实和场景理解至关重要。对于已见物体,通常可以通过 per-object 微调实现高精度,但将其推广到未见物体仍是一个挑战。为此,过往方法假设在测试时间获取 CAD 模型,通常遵循多阶段管线来估计姿态:检测和分割物体,提出初始姿态,然后进行细化。在遮挡情况下,然而,这类管线的早期阶段容易出错,这些错误会通过顺序处理传播,从而导致性能下降。为补救这一不足,我们提出了四项对模型基6D姿态估计方法的新颖扩展:(i) 一种动态非均匀稠密抽样策略,聚焦计算于可见区域,减少由遮挡引起的误差;(ii) 一种多假设推理机制,保留几个置信度排序的姿态候选,缓解脆弱的单路径故障;(iii) 迭代细化,以逐步提高姿态精度;(iv) 一系列针对遮挡的训练数据增强,增强鲁棒性和泛化能力。此外,我们提出了一种新的加权可见性度量,用于在遮挡情况下进行评估,以最小化现有协议中的偏差。通过大量实证评估,我们表明我们的方法在 ICBIN 和 BOP 数据集基准上分别实现了超过5%和2%的精度提升,同时实现了约3倍的推理速度。
引用
@article{arxiv.2511.15874,
title = {WALDO: Where Unseen Model-based 6D Pose Estimation Meets Occlusion},
author = {Sajjad Pakdamansavoji and Yintao Ma and Amir Rasouli and Tongtong Cao},
journal= {arXiv preprint arXiv:2511.15874},
year = {2025}
}