复现BowNet:通过预测视觉词袋学习表征
计算机视觉与模式识别
2022-01-19 v2 机器学习
摘要
本工作旨在复现Gidaris等人CVPR 2020论文的结果。自监督学习(SSL)利用无标签数据集学习图像的特征表征。本工作提出使用词袋(BoW)深度特征描述子作为自监督学习目标,以学习鲁棒的深度表征。BowNet被训练为:当输入一幅图像的扰动版本时,重建该参考图像的视觉词直方图(即深度BoW描述子)。因此,该方法旨在学习与扰动无关且具上下文感知的图像特征,可用于少样本任务或监督下游任务。论文中,作者将BowNet描述为一个由卷积特征提取器和稠密softmax层组成的网络,训练其从图像预测BoW特征。BoW训练后,的特征被用于下游任务。在本次挑战中,我们试图构建并训练一个能复现原论文所报告CIFAR-100精度提升的网络。然而,我们未能复现出与作者所述相当的精度提升。这可能由多种因素导致,我们认为时间限制是主要瓶颈。
引用
@article{arxiv.2201.03556,
title = {Reproducing BowNet: Learning Representations by Predicting Bags of Visual Words},
author = {Harry Nguyen and Stone Yun and Hisham Mohammad},
journal= {arXiv preprint arXiv:2201.03556},
year = {2022}
}
备注
This is a reproducibility project. Original work is by Gidaris et al. published in CVPR 2020. Pytorch implementation is public on Github. v2 clarifies comments regarding communication with original authors