中文

ClusterFit:提升视觉表示的泛化能力

计算机视觉与模式识别 2019-12-10 v1 机器学习

摘要

利用弱监督与自监督策略预训练卷积神经网络在若干计算机视觉任务中正变得日益流行。然而,由于缺乏强判别信号,这些学习到的表示可能过拟合于预训练目标(例如哈希标签预测)而不能很好地泛化到下游任务。在本工作中,我们提出一种简单策略——ClusterFit(CF),以改善预训练期间所学视觉表示的鲁棒性。给定数据集,我们(a)使用k-means对预训练网络提取的特征进行聚类,并(b)使用该数据集上的聚类指派作为伪标签从头重新训练一个新网络。我们通过实验表明,聚类有助于从所提取特征中减少预训练任务特定信息,从而最小化对它的过拟合。我们的方法可扩展至不同预训练框架——弱监督与自监督、不同模态——图像与视频、以及预训练任务——物体与动作分类。通过对11个不同词汇与粒度目标数据集的广泛迁移学习实验,我们表明ClusterFit相比最先进的百万/十亿规模弱监督图像与视频模型以及自监督图像模型显著提升了表示质量。

关键词

引用

@article{arxiv.1912.03330,
  title  = {ClusterFit: Improving Generalization of Visual Representations},
  author = {Xueting Yan and Ishan Misra and Abhinav Gupta and Deepti Ghadiyaram and Dhruv Mahajan},
  journal= {arXiv preprint arXiv:1912.03330},
  year   = {2019}
}