FoveaNet:感知透视的城市场景解析
计算机视觉与模式识别
2017-08-09 v1
摘要
城市场景图像解析有益于许多应用,尤其是自动驾驶。当前的大多数解决方案采用通用图像解析模型,这些模型同等地处理图像中的所有尺度和位置,且未考虑车辆拍摄的城市场景图像的几何特性。因此,它们受制于由相机对实际场景透视投影引起的异构目标尺度,并不可避免地在远距离目标以及其他边界和识别错误上遭遇解析失败。在本工作中,我们提出了一种新的 FoveaNet 模型,以充分利用场景图像的透视几何并解决通用解析模型的常见失败。FoveaNet 通过一个卷积网络估计场景图像的透视几何,该网络整合了图像内上下文目标的支持证据。基于透视几何信息,FoveaNet “撤销”相机透视投影,在实际场景空间中分析区域,从而提供更可靠的解析结果。此外,为了有效解决识别错误,FoveaNet 引入了一种新的密集 CRFs 模型,将透视几何作为先验势能。我们在两个城市场景解析数据集 Cityspaces 和 CamVid 上评估了 FoveaNet,结果表明 FoveaNet 优于所有成熟的基线,并提供了新的 SOTA 性能。
引用
@article{arxiv.1708.02421,
title = {FoveaNet: Perspective-aware Urban Scene Parsing},
author = {Xin Li and Zequn Jie and Wei Wang and Changsong Liu and Jimei Yang and Xiaohui Shen and Zhe Lin and Qiang Chen and Shuicheng Yan and Jiashi Feng},
journal= {arXiv preprint arXiv:1708.02421},
year = {2017}
}