PixelNet:迈向通用的像素级架构
计算机视觉与模式识别
2016-09-22 v1 机器学习
摘要
我们探索用于通用像素级预测问题的架构,涵盖从低层边缘检测到中层表面法线估计再到高层语义分割。卷积预测器,如全卷积网络(FCN),通过卷积处理利用相邻像素的空间冗余性,取得了显著成功。尽管计算效率高,我们指出此类方法在学习阶段的统计效率并不高,正是因为空间冗余性限制了从相邻像素中学习的信息。我们证明:(1)分层采样使我们能够在批量更新时增加多样性;(2)采样的多尺度特征使我们能够探索更多非线性预测器(多个全连接层后接 ReLU),从而提高整体准确率。最后,我们的目标是展示一种架构如何获得比专为特定任务设计的架构更好(或相当)的性能。有趣的是,我们的单一架构在 PASCAL-Context 上的语义分割、NYUDv2 数据集上的表面法线估计以及 BSDS 上的边缘检测中均产生了 SOTA 结果,且无需上下文后处理。
引用
@article{arxiv.1609.06694,
title = {PixelNet: Towards a General Pixel-level Architecture},
author = {Aayush Bansal and Xinlei Chen and Bryan Russell and Abhinav Gupta and Deva Ramanan},
journal= {arXiv preprint arXiv:1609.06694},
year = {2016}
}