中文

用于精简像素标注的像素级注意力门控

计算机视觉与模式识别 2018-12-20 v2

摘要

为了在有限计算预算下实现逐像素标注任务的精简推断,我们提出了一种像素级注意力门控单元(PAG),它学习在深度卷积网络的每一层有选择地处理空间位置的子集。PAG 是一种通用的、与架构无关、与问题无关的 mechanism,可通过微调轻松“插入”现有模型。我们以两种方式使用 PAG:1)学习空间变化的池化域,在不带来多尺度池化额外计算成本的情况下提升模型性能;2)为每个像素学习动态计算策略,以降低总计算量同时保持精度。我们在多种逐像素标注任务上广泛评估了 PAG,包括语义分割、边界检测、单目深度与表面法线估计。我们证明 PAG 在这些任务上取得了有竞争力或最先进的性能。我们的实验表明,PAG 学习对输入图像上计算的动态空间分配,相比相关方法(如截断深度模型或动态跳过整个层)提供了更好的性能权衡。总体而言,我们观察到 PAG 可在精度无明显损失的情况下减少 10% 的计算量,且在施加更强计算约束时性能优雅退化。

关键词

引用

@article{arxiv.1805.01556,
  title  = {Pixel-wise Attentional Gating for Parsimonious Pixel Labeling},
  author = {Shu Kong and Charless Fowlkes},
  journal= {arXiv preprint arXiv:1805.01556},
  year   = {2018}
}

备注

https://www.ics.uci.edu/~skong2/PAG.html