COPE:端到端可训练的恒定运行时间物体位姿估计
计算机视觉与模式识别
2022-08-23 v2
摘要
最先进的物体位姿估计通过使用多模型公式处理测试图像中的多个实例:第一阶段进行检测,随后针对每个物体使用单独训练的网络预测 2D-3D 几何对应,作为第二阶段。位姿随后在运行时间使用 Perspective-n-Points 算法估计。遗憾的是,多模型公式速度慢,且随所涉物体实例数量的增加难以良好扩展。近期方法表明,由上述几何对应导出直接 6D 物体位姿估计是可行的。我们提出一种方法,学习多个物体的中间几何表示,以直接回归测试图像中所有实例的 6D 位姿。其固有的端到端可训练性克服了分别处理各个物体实例的需求。通过计算相互的 Intersection-over-Unions,将位姿假设聚为不同实例,相对于物体实例数量实现了可忽略的运行时间开销。在多个具有挑战性的标准数据集上的结果表明,尽管速度快逾约 35 倍,位姿估计性能仍优于单模型最先进方法。我们另提供一项分析,表明在存在超过 90 个物体实例的图像中具实时适用性(>24 fps)。进一步结果显示以 6D 位姿监督基于几何对应的物体位姿估计的优势。
引用
@article{arxiv.2208.08807,
title = {COPE: End-to-end trainable Constant Runtime Object Pose Estimation},
author = {Stefan Thalhammer and Timothy Patten and Markus Vincze},
journal= {arXiv preprint arXiv:2208.08807},
year = {2022}
}