稀疏多目标渲染比对方法
计算机视觉与模式识别
2023-10-18 v1
摘要
从单幅图像重建静态物体的三维形状与位姿是机器人、增强现实和数字内容创作等多个行业的一项基础任务。这可以通过直接以各种表示预测三维形状,或从数据库检索 CAD 模型并预测其对齐方式来完成。直接预测三维形状常产生不真实、过度平滑或细分的形状。检索 CAD 模型可确保形状真实,但需要鲁棒且准确的对齐。从图像特征直接学习预测 CAD 模型位姿具有挑战性且不准确。诸如 ROCA 等工作从预测的标准化物体坐标计算位姿,可能更准确但易出现系统性失败。SPARC 表明,遵循“渲染比对(render-and-compare)”思路、由网络迭代改进自身预测可实现准确对齐。然而,它对图像中检测到的每个物体单独进行 CAD 对齐。该方法应用于多物体时速度慢,因时间复杂度随物体数量线性增长,且无法学习物体间关系。本文提出新网络架构 Multi-SPARC,可联合学习对多个检测物体的 CAD 模型对齐。相较于其他单视图方法,我们在具有挑战性的真实世界数据集 ScanNet 上取得了 SOTA 性能。我们将实例对齐准确率从 31.8% 提升至 40.3%,表现接近于 SOTA 多视图方法。
引用
@article{arxiv.2310.11184,
title = {Sparse Multi-Object Render-and-Compare},
author = {Florian Langer and Ignas Budvytis and Roberto Cipolla},
journal= {arXiv preprint arXiv:2310.11184},
year = {2023}
}