中文

Tencent ML-Images:用于视觉表征学习的大规模多标签图像数据库

计算机视觉与模式识别 2020-02-11 v7

摘要

在现有的视觉表征学习任务中,深度卷积神经网络(CNNs)常在带有单标签标注的图像上训练,例如ImageNet。然而,单个标签无法描述一幅图像的所有重要内容,部分有用的视觉信息可能在训练中被浪费。本工作中,我们提出从带有多个标签标注的图像训练CNNs,以提升所训练CNN模型的视觉表征质量。为此,我们构建了一个包含1800万图像和1.1万类别的大规模多标签图像数据库,称为Tencent ML-Images。我们基于大规模分布式深度学习框架TFplus,在Tencent ML-Images上以多标签输出高效训练ResNet-101模型,60个周期耗时90小时。Tencent ML-Images检查点的视觉表征质量通过三项迁移学习任务得到验证,包括在ImageNet和Caltech-256上的单标签图像分类、PASCAL VOC 2007上的目标检测,以及PASCAL VOC 2012上的语义分割。Tencent ML-Images数据库、ResNet-101检查点及全部训练代码已发布于 https://github.com/Tencent/tencent-ml-images。期望其能推动研究与工业界的其他视觉任务。

关键词

引用

@article{arxiv.1901.01703,
  title  = {Tencent ML-Images: A Large-Scale Multi-Label Image Database for Visual Representation Learning},
  author = {Baoyuan Wu and Weidong Chen and Yanbo Fan and Yong Zhang and Jinlong Hou and Jie Liu and Tong Zhang},
  journal= {arXiv preprint arXiv:1901.01703},
  year   = {2020}
}

备注

This work is accepted to IEEE Access