中文

面向零样本迁移学习的组合缩放方法

机器学习 2023-04-13 v3 计算与语言 计算机视觉与模式识别

摘要

我们提出了一种称为 BASIC 的组合缩放方法,该方法在不从任何带标签的 ImageNet 样本中学习的情况下,在 ImageNet ILSVRC-2012 验证集上达到了 85.7% 的 top-1 准确率。该准确率超越了已发表的最佳同类模型 CLIP 和 ALIGN 达 9.3%。我们的 BASIC 模型在鲁棒性基准测试中也显示出显著提升。例如,在 ImageNet-{A,R,V2,Sketch} 和 ObjectNet 等 5 个具有自然分布偏移的测试集上,我们的模型达到了 84.3% 的 top-1 平均准确率,仅比其原始 ImageNet 准确率有小幅下降。为取得这些结果,我们在三个维度上缩放了 CLIP 和 ALIGN 的对比学习框架:数据规模、模型规模和批大小。我们的数据集包含 6.6B 个噪声图文对,比 ALIGN 大 4 倍,比 CLIP 大 16 倍。我们最大的模型具有 3B 参数,其参数量是 ALIGN 和 CLIP 的 3.75 倍,FLOPs 是它们的 8 倍。最后,我们的批大小为 65536,是 CLIP 的 2 倍,ALIGN 的 4 倍。我们在 BASIC 的缩放规则上遇到了两个主要挑战。首先,实现 BASIC 组合缩放规则的主要挑战是 GPU 和 TPU 等加速器的内存有限。为克服内存限制,我们提出了两种利用梯度检查点和模型并行性的简单方法。其次,尽管增大数据集规模和模型规模一直是改进 BASIC 等深度学习模型性能的既定方法,但大对比批大小对此类对比训练的图文模型的影响尚不清楚。为阐明大对比批大小的益处,我们建立了一个理论框架,表明更大的对比批大小会带来如 BASIC 等图文模型更小的泛化差距。

关键词

引用

@article{arxiv.2111.10050,
  title  = {Combined Scaling for Zero-shot Transfer Learning},
  author = {Hieu Pham and Zihang Dai and Golnaz Ghiasi and Kenji Kawaguchi and Hanxiao Liu and Adams Wei Yu and Jiahui Yu and Yi-Ting Chen and Minh-Thang Luong and Yonghui Wu and Mingxing Tan and Quoc V. Le},
  journal= {arXiv preprint arXiv:2111.10050},
  year   = {2023}
}