中文

在无监督且无筛选的图像上预训练时视觉模型更鲁棒且更公平

计算机视觉与模式识别 2022-02-23 v2 人工智能 计算机与社会

摘要

判别性自监督学习允许在任何随机的互联网图像组上训练模型,并可能恢复有助于区分图像的显著信息。应用于 ImageNet 时,这会产生以物体为中心的特征,在大多数以物体为中心的下游任务上与有监督特征表现相当。在本工作中,我们探讨利用该能力,能否从全球各地多样且无界的图像集合中学习到任何显著的且更具代表性的信息。为此,我们在数十亿随机图像上训练模型,无任何数据预处理,也不对模型应学内容作先验假设。我们将模型规模扩展至稠密 100 亿参数,以避免在大数据量下欠拟合。我们在超过 50 个基准上广泛研究并验证模型性能,包括公平性、对分布偏移的鲁棒性、地理多样性、细粒度识别、图像拷贝检测及诸多图像分类数据集。所得模型不仅良好捕捉语义信息,还捕捉艺术风格信息,并仅基于视觉内容学习到如地理位置与多语言词嵌入等显著信息。更重要的是,我们发现此类模型比有监督模型或在以物体为中心的数据集(如 ImageNet)上训练的模型更鲁棒、更公平、危害更小且偏差更少。

关键词

引用

@article{arxiv.2202.08360,
  title  = {Vision Models Are More Robust And Fair When Pretrained On Uncurated Images Without Supervision},
  author = {Priya Goyal and Quentin Duval and Isaac Seessel and Mathilde Caron and Ishan Misra and Levent Sagun and Armand Joulin and Piotr Bojanowski},
  journal= {arXiv preprint arXiv:2202.08360},
  year   = {2022}
}