中文

超越随机增强:使用困难视图的预训练

计算机视觉与模式识别 2025-02-07 v6 人工智能

摘要

自监督学习(SSL)方法通常依赖于随机图像增强,或称视图,以使模型对不同的变换保持不变性。我们假设,基于常规随机视图采样的预训练流程的效能,可通过显式选择有益于学习进程的视图来增强。一种简单而有效的做法是选择产生较高损失的困难视图。本文提出困难视图预训练(HVP),一种无学习策略,它通过在对 SSL 预训练期间向模型暴露更具挑战性的样本来扩展随机视图生成。HVP 包含以下迭代步骤:1)随机采样多个视图并逐一通过预训练模型前向传播,2)创建两个视图的对并计算其损失,3)根据当前模型状态对抗性地选择产生最高损失的对,4)用所选对执行反向传播。与现有困难视图文献不同,我们首次证明了困难视图预训练在大规模下的有效性,特别是在完整 ImageNet-1k 数据集上训练,并在多种 SSL 方法、ConvNets 与 ViTs 上评估。因此,HVP 在 DINO ViT-B/16 上确立了新的最先进水平,达到 78.8% 线性评估准确率(提升 0.6%),并在 100 与 300 轮预训练下均有一致 1% 的增益,在 DINO、SimSiam、iBOT 与 SimCLR 的迁移任务中也有类似改进。

关键词

引用

@article{arxiv.2310.03940,
  title  = {Beyond Random Augmentations: Pretraining with Hard Views},
  author = {Fabio Ferreira and Ivo Rapant and Jörg K. H. Franke and Frank Hutter},
  journal= {arXiv preprint arXiv:2310.03940},
  year   = {2025}
}