中文

学习直接优化用于场景理解

计算机视觉与模式识别 2020-05-08 v2 图形学 机器学习

摘要

我们提出了一种学习直接优化(LiDO)方法,用于细化描述输入图像x的潜变量模型。我们的目标是以可解释的3D计算机图形模型(具有场景图潜变量z,如物体外观、相机位置)来解释单幅图像x。给定z的当前估计,我们可以渲染图像的预测g(z),并将其与图像x进行比较。标准做法是度量两者之间的误差E(x, g(z)),并使用优化器最小化该误差。然而,尚不清楚哪种误差度量E能最有效地同时处理物体错位、遮挡、纹理等问题。相反,LiDO方法训练一个预测网络直接预测对z的更新以进行修正,而不是相对于z最小化误差。实验表明,我们的LiDO方法收敛迅速,因为它无需在误差曲面上进行搜索,比基于误差的竞争者产生更好的解,并且能够处理数据与拟合场景模型之间的不匹配。我们将LiDO应用于一个逼真的合成数据集,并表明该方法也能迁移到真实图像上表现良好。

关键词

引用

@article{arxiv.1812.07524,
  title  = {Learning Direct Optimization for Scene Understanding},
  author = {Lukasz Romaszko and Christopher K. I. Williams and John Winn},
  journal= {arXiv preprint arXiv:1812.07524},
  year   = {2020}
}