从图像中恢复场景几何的机器学习方法
计算机视觉与模式识别
2010-07-20 v1 机器学习
摘要
从图像中恢复场景的3D结构,可为形状与场景识别、目标检测,或机器人中的运动规划与物体抓取等任务提供有用信息。在本论文中,我们引入了一种基于最大化条件似然的通用机器学习方法,称为无监督CRF学习。我们将该方法应用于从图像中恢复3D场景几何的计算机视觉系统。我们重点关注从单幅图像、立体图像对和视频序列中恢复3D几何。构建这些系统需要用于进行推断以及学习条件马尔可夫随机场(MRF)参数的算法。我们的系统在未使用真实标注数据的情况下进行无监督训练。我们采用倾斜平面立体视觉模型,其中使用固定的过分割将左图像分割为称为超像素的连贯区域,然后为每个超像素分配一个视差平面。通过最小化能量函数求解MRF标号问题,来估计平面参数。我们展示了无监督CRF学习算法在包含从纹理线索恢复形状的参数化倾斜平面立体视觉模型中的应用。结合纹理线索的立体模型,仅通过无监督训练,就在相同立体数据集上优于相关工作的结果。在本论文中,我们还将结构与运动估计表述为能量最小化问题,其中该模型是我们倾斜平面立体视觉模型的扩展,同时处理表面速度。速度估计是通过使用Loopy BP求解MRF标号问题来实现的。性能分析使用基于视图预测误差概念的新型评估指标进行。对道路驾驶立体序列的实验显示了令人鼓舞的结果。
引用
@article{arxiv.1007.2958,
title = {A Machine Learning Approach to Recovery of Scene Geometry from Images},
author = {Hoang Trinh},
journal= {arXiv preprint arXiv:1007.2958},
year = {2010}
}