中文

复现BowNet:通过预测视觉词袋学习表征

计算机视觉与模式识别 2022-01-19 v2 机器学习

摘要

本工作旨在复现Gidaris等人CVPR 2020论文的结果。自监督学习(SSL)利用无标签数据集学习图像的特征表征。本工作提出使用词袋(BoW)深度特征描述子作为自监督学习目标,以学习鲁棒的深度表征。BowNet被训练为:当输入一幅图像的扰动版本时,重建该参考图像的视觉词直方图(即深度BoW描述子)。因此,该方法旨在学习与扰动无关且具上下文感知的图像特征,可用于少样本任务或监督下游任务。论文中,作者将BowNet描述为一个由卷积特征提取器Φ()\Phi(\cdot)和稠密softmax层Ω()\Omega(\cdot)组成的网络,训练其从图像预测BoW特征。BoW训练后,Φ\Phi的特征被用于下游任务。在本次挑战中,我们试图构建并训练一个能复现原论文所报告CIFAR-100精度提升的网络。然而,我们未能复现出与作者所述相当的精度提升。这可能由多种因素导致,我们认为时间限制是主要瓶颈。

关键词

引用

@article{arxiv.2201.03556,
  title  = {Reproducing BowNet: Learning Representations by Predicting Bags of Visual Words},
  author = {Harry Nguyen and Stone Yun and Hisham Mohammad},
  journal= {arXiv preprint arXiv:2201.03556},
  year   = {2022}
}

备注

This is a reproducibility project. Original work is by Gidaris et al. published in CVPR 2020. Pytorch implementation is public on Github. v2 clarifies comments regarding communication with original authors