无蒸馏信号下小型自监督对比模型的有效性研究
机器学习
2021-12-14 v2 计算机视觉与模式识别
摘要
学界共识是小型模型在自监督对比学习范式下表现相当差。现有方法通常采用大型现成模型通过蒸馏将知识迁移给小型模型。尽管有效,基于蒸馏的方法因部署大型模型带来的巨大计算开销,可能并不适合某些资源受限场景。本文研究在无蒸馏信号下训练自监督小型模型的问题。我们首先评估小型模型的表示空间并作出两个不可忽略的观察:(i)尽管容量有限,小型模型能完成 pretext 任务而不发生过拟合;(ii)它们普遍遭受过度聚类问题。随后我们验证了多个被认为可缓解过度聚类现象的假设。最后,我们组合已验证的技术,以可观幅度提升了五种小型架构的基线性能,这表明即便无蒸馏信号,训练小型自监督对比模型也是可行的。代码见 \textit{https://github.com/WOWNICE/ssl-small}。
引用
@article{arxiv.2107.14762,
title = {On the Efficacy of Small Self-Supervised Contrastive Models without Distillation Signals},
author = {Haizhou Shi and Youcai Zhang and Siliang Tang and Wenjie Zhu and Yaqian Li and Yandong Guo and Yueting Zhuang},
journal= {arXiv preprint arXiv:2107.14762},
year = {2021}
}
备注
Accepted by AAAI'22