中文

知识浓缩:在单一CNN中学习10万类物体分类器

计算机视觉与模式识别 2017-11-27 v2

摘要

细粒度图像标签对于许多计算机视觉应用(如视觉搜索或移动AI助手)是必需的。这些应用依赖于能够对输入图像产生数十万(如10万)种多样化细粒度图像标签的图像分类模型。然而,在此词汇规模上训练网络具有挑战性,且受限于难以接受的大模型尺寸与缓慢训练速度,导致分类性能不尽人意。一种直接的解决方案是训练独立的专家网络( specialists),每个专家专注于学习一个特定垂直领域(如汽车、鸟类……)。然而,在实际系统中部署数十个专家网络会显著增加系统复杂度和推理延迟,并消耗大量计算资源。为应对这些挑战,我们提出一种知识浓缩(Knowledge Concentration)方法,将数十个专家(多个教师网络)的知识有效迁移到单一模型(一个学生网络)中以分类10万类物体。我们的方法有三个显著方面:(1)多教师单学生的知识蒸馏框架;(2)自步学习机制,使学生以不同步调向不同教师学习;(3)结构连接层,以有限的额外参数扩展学生网络容量。我们在OpenImage和一个新收集的数据集Entity-Foto-Tree(EFT,含10万类)上验证了方法,并显示所提模型显著优于基线通才模型。

关键词

引用

@article{arxiv.1711.07607,
  title  = {Knowledge Concentration: Learning 100K Object Classifiers in a Single CNN},
  author = {Jiyang Gao and Zijian and Guo and Zhen Li and Ram Nevatia},
  journal= {arXiv preprint arXiv:1711.07607},
  year   = {2017}
}