中文

面向结构化视觉预测任务的高表达力表示学习

计算机视觉与模式识别 2019-09-02 v1 机器学习

摘要

我们描述了一种为图像学习丰富表示的方法,该方法使得在一系列涉及空间结构化映射的视觉任务中能够使用简单而有效的预测器。我们的核心思想是将小的图像元素映射到从一系列空间范围递增的嵌套区域中提取的特征表示。这些区域通过从像素/超像素一直“缩小”到场景级分辨率获得,因此我们称之为缩小特征(zoom-out features)。应用于语义分割及其他结构化预测任务时,我们的方法利用了图像和标签空间中的统计结构,而无需建立显式的结构化预测机制,从而避免了复杂且昂贵的推断。相反,图像元素由一个具有跨越缩小各层的跳跃连接的前馈多层网络进行分类。当与现代神经架构(如 ResNet、DenseNet 和 NASNet,且与之互补)结合使用时,我们的方法在分割基准上取得了有竞争力的精度。此外,我们提出了一种仅从图像级分类标签学习类别级语义分割的方法。它利用为分类任务定制的改进缩小架构训练中所涌现的定位线索,来驱动一个弱监督过程,自动标注稀疏且多样的、可能属于感兴趣类别的点训练集。最后,我们引入了用于 CNN 监督训练的数据驱动正则化函数。我们的创新在于通过学习一个在标注集合上的自编码器导出的正则化器。该方法利用改进的标签空间表示来指导从图像中提取特征。

关键词

引用

@article{arxiv.1908.11820,
  title  = {Learning Rich Representations For Structured Visual Prediction Tasks},
  author = {Mohammadreza Mostajabi},
  journal= {arXiv preprint arXiv:1908.11820},
  year   = {2019}
}

备注

PhD Thesis