用于大规模弱监督视觉的硬专家混合模型
计算机视觉与模式识别
2017-04-24 v1 机器学习
摘要
训练适配单个GPU并使用小批量随机梯度下降的卷积网络(CNN)已在实践中变得有效。然而,对于训练无法装入少数GPU卡内存的大型CNN,或并行化CNN训练,仍无有效方法。在这项工作中,我们展示了一个简单的硬专家混合模型可以在大规模标签(多标签)预测任务上被高效训练并取得良好效果。专家混合模型并不新鲜(Jacobs等1991,Collobert等2003),但过去研究者不得不设计复杂方法来处理数据碎片。我们通过经验表明,现代弱监督数据集足够大,足以支持朴素划分方案,其中每个数据点被分配给单个专家。由于专家相互独立,并行训练它们很容易,且对于模型规模评估代价低。此外,我们展示我们可以为所有专家使用单一解码层,从而允许统一的特征嵌入空间。我们证明训练比使用标准CNN架构实际可训练的大得多的模型是可行的(且事实上相对轻松),并且额外容量可以在当前数据集上得到充分利用。
引用
@article{arxiv.1704.06363,
title = {Hard Mixtures of Experts for Large Scale Weakly Supervised Vision},
author = {Sam Gross and Marc'Aurelio Ranzato and Arthur Szlam},
journal= {arXiv preprint arXiv:1704.06363},
year = {2017}
}
备注
Appearing in CVPR 2017