通过聚合扩散特征进行物体姿态估计
计算机视觉与模式识别
2024-10-21 v3
摘要
从图像中估计物体姿态是3D场景理解的关键任务,近期的方法在非常大的基准测试上展现了有前景的结果。然而,这些方法在处理未见物体时性能显著下降。我们认为这源于图像特征泛化能力的局限性。为解决此问题,我们深入分析了扩散模型(如 Stable Diffusion)的特征,这些特征在建模未见物体方面具有巨大潜力。基于此分析,我们创新性地将扩散特征引入物体姿态估计。为此,我们提出了三种不同的架构,能够有效捕获并聚合不同粒度的扩散特征,极大提升了物体姿态估计的泛化能力。我们的方法在三个流行的基准数据集 LM、O-LM 和 T-LESS 上以显著优势优于 SOTA 方法。特别是在未见物体上,我们的方法取得了高于先前最优方法的准确率:在 Unseen LM 上为 97.9% 对 93.5%,在 Unseen O-LM 上为 85.9% 对 76.3%,展示了我们方法强大的泛化能力。代码已发布于 https://github.com/Tianfu18/diff-feats-pose。
引用
@article{arxiv.2403.18791,
title = {Object Pose Estimation via the Aggregation of Diffusion Features},
author = {Tianfu Wang and Guosheng Hu and Hongguang Wang},
journal= {arXiv preprint arXiv:2403.18791},
year = {2024}
}
备注
Accepted to CVPR2024, fix typo