DVMNet++:面向未知物体相对位姿估计的再思考
计算机视觉与模式识别
2025-03-18 v2 机器人学
摘要
确定两张图像中先前未见过的物体的相对位姿,对于可泛化的物体位姿估计的成功至关重要。现有方法通常利用真实物体边界框预测三维平移,并通过大量离散假设来近似三维旋转。这种策略对真实边界框的可用性做出了不切实际的假设,并在测试时对每个假设进行评分,导致计算成本高昂。相比之下,我们通过提出深度体素匹配网络(DVMNet++)重新思考了未知物体的相对位姿估计问题。我们的方法在单次前向传播中计算相对物体位姿,消除了对真实物体边界框和旋转假设的需求。我们通过利用图像特征嵌入和自然语言理解作为参考,实现了开放集物体检测。然后,利用检测结果来近似平移参数,并从查询图像中裁剪出物体。对于旋转估计,我们将两张RGB图像(即参考图像和裁剪后的查询图像)映射到它们各自的体素化三维表示。生成的体素通过一个旋转估计模块,该模块对齐体素并通过求解最小二乘问题以端到端的方式计算旋转。为了增强鲁棒性,我们引入了一种加权最近体素算法,能够减轻噪声体素的影响。我们在CO3D、Objaverse、LINEMOD和LINEMOD-O数据集上进行了大量实验,证明与现有最先进方法相比,我们的方法能够以更低的计算成本为新颖物体提供更准确的相对位姿估计。我们的代码已发布在https://github.com/sailor-z/DVMNet/。
引用
@article{arxiv.2403.13683,
title = {DVMNet++: Rethinking Relative Pose Estimation for Unseen Objects},
author = {Chen Zhao and Tong Zhang and Zheng Dang and Mathieu Salzmann},
journal= {arXiv preprint arXiv:2403.13683},
year = {2025}
}