中文

SPARC:基于稀疏渲染-比对在单张RGB图像中的CAD模型对齐

计算机视觉与模式识别 2022-10-04 v1

摘要

从单张图像估计静态物体的3D形状与位姿在机器人、增强现实与数字内容创作中有重要应用。这通常通过直接网格预测(产生不真实、过度细分的形状)或将形状预测表述为检索任务后接CAD模型对齐来完成。直接从2D图像特征预测CAD模型位姿困难且不精确。一些工作如ROCA回归归一化物体坐标并用于计算位姿。尽管这可产生更精确的位姿估计,预测归一化物体坐标易出现系统性失败。借助高效transformer架构,我们证明稀疏、迭代的渲染-比对方法比依赖归一化物体坐标更准确、更鲁棒。为此,我们将从图像直接估计的含稀疏深度与表面法向值在内的2D图像信息与3D CAD模型信息在早期融合中结合。具体地,我们从CAD模型在初始随机位姿下采样点并重新投影,计算其深度与表面法向值。该组合信息作为位姿预测网络SPARC-Net的输入,我们训练其预测9自由度CAD模型位姿更新。CAD模型被再次重投影并预测下一处位姿更新。我们的对齐过程仅3次迭代即收敛,在具有挑战性的真实世界数据集ScanNet上将实例对齐准确率从25.0%提升至31.8%的SOTA性能。代码将发布于https://github.com/florianlanger/SPARC。

关键词

引用

@article{arxiv.2210.01044,
  title  = {SPARC: Sparse Render-and-Compare for CAD model alignment in a single RGB image},
  author = {Florian Langer and Gwangbin Bae and Ignas Budvytis and Roberto Cipolla},
  journal= {arXiv preprint arXiv:2210.01044},
  year   = {2022}
}