中文

TernausNet:在 ImageNet 上预训练的 VGG11 编码器用于图像分割的 U-Net

计算机视觉与模式识别 2018-01-18 v1

摘要

逐像素图像分割是计算机视觉中的一项高要求任务。由编码器和解码器组成的经典 U-Net 架构在医学图像、卫星图像等分割中非常流行。通常,使用在 ImageNet 等大型数据集上预训练的网络权重初始化的神经网络,比在小数据集上从头训练的网络表现更好。在一些实际应用中,特别是医学和交通安全领域,模型的准确性至关重要。在本文中,我们展示了如何通过使用预训练编码器来改进 U-Net 类型的架构。我们的代码和相应的预训练权重公开于 https://github.com/ternaus/TernausNet。我们比较了三种权重初始化方案:LeCun 均匀初始化、带有 VGG11 权重的编码器,以及在 Carvana 数据集上训练的完整网络。该网络架构是 Kaggle: Carvana Image Masking Challenge(共 735 支队伍中第 1 名)获胜方案的一部分。

关键词

引用

@article{arxiv.1801.05746,
  title  = {TernausNet: U-Net with VGG11 Encoder Pre-Trained on ImageNet for Image Segmentation},
  author = {Vladimir Iglovikov and Alexey Shvets},
  journal= {arXiv preprint arXiv:1801.05746},
  year   = {2018}
}

备注

5 pages, 4 figures