单一网络并非通吃:在自监督学习中超越手工设计架构
计算机视觉与模式识别
2022-03-16 v1 人工智能
机器学习
摘要
当前自监督学习(SSL)的文献侧重于开发学习目标,以在未标记数据上更有效地训练神经网络。典型的开发过程涉及采用成熟的架构(例如,在 ImageNet 上验证的 ResNet)并用它们来评估新开发的目标在下游场景中的表现。虽然方便,但这并未考虑架构的作用,而已有研究表明该作用在监督学习文献中至关重要。在这项工作中,我们建立了广泛的经验证据,表明网络架构在 SSL 中起着重要作用。我们对超过 100 种 ResNet 和 MobileNet 架构变体进行了大规模研究,并在 SSL 设置下跨 11 个下游场景对它们进行评估。我们表明,没有一个网络能在所有场景中持续表现良好。基于此,我们提出在 SSL 机制中不仅学习网络权重,还学习架构拓扑。我们表明,“自监督架构”优于流行的手工设计架构(ResNet18 和 MobileNetV2),同时在主要图像分类基准(ImageNet-1K、iNat2021 等)上与更大且计算繁重的 ResNet50 具有竞争力。我们的结果表明,是时候考虑在 SSL 中超越手工设计架构,并开始思考将架构搜索纳入自监督学习目标中。
引用
@article{arxiv.2203.08130,
title = {One Network Doesn't Rule Them All: Moving Beyond Handcrafted Architectures in Self-Supervised Learning},
author = {Sharath Girish and Debadeepta Dey and Neel Joshi and Vibhav Vineet and Shital Shah and Caio Cesar Teodoro Mendes and Abhinav Shrivastava and Yale Song},
journal= {arXiv preprint arXiv:2203.08130},
year = {2022}
}