中文

利用几何信息从单张RGB图像进行形状估计

计算机视觉与模式识别 2021-11-11 v1

摘要

从单张RGB图像预测静态物体的三维形状与位姿是现代计算机视觉中的一个重要研究方向。其应用涵盖增强现实、机器人与数字内容创作。通常该任务通过直接预测物体形状与位姿来完成,但精度不足。一个有前景的研究方向通过从大规模数据库中检索CAD模型并将其与图像中观测到的物体对齐,从而保证有意义的形状预测。然而,现有工作未考虑物体几何,导致不准确的物体位姿预测,尤其对于未见过的物体。本文中,我们展示了从RGB图像到渲染CAD模型的跨域关键点匹配相比直接预测能获得更精确的物体位姿预测。我们进一步表明,关键点匹配不仅可用于估计物体位姿,还可用于修改物体本身的形状。这一点很重要,因为仅通过物体检索所能达到的精度本质上受限于可用的CAD模型。允许形状自适应弥合了检索到的CAD模型与观测形状之间的差距。我们在具有挑战性的Pix3D数据集上展示了我们的方法。所提出的几何形状预测在已见物体上将AP mesh从SOTA的33.2提升至37.8,在未见物体上从8.2提升至17.1。此外,在采用所提形状自适应时,我们展示了无需紧密匹配CAD模型即可获得更准确的形状预测。代码公开于https://github.com/florianlanger/leveraging_geometry_for_shape_estimation。

关键词

引用

@article{arxiv.2111.05615,
  title  = {Leveraging Geometry for Shape Estimation from a Single RGB Image},
  author = {Florian Langer and Ignas Budvytis and Roberto Cipolla},
  journal= {arXiv preprint arXiv:2111.05615},
  year   = {2021}
}