无需无监督的理由:有监督模型中改进的泛化能力
计算机视觉与模式识别
2023-03-13 v2 机器学习
摘要
我们考虑在给定分类任务(例如 ImageNet-1K (IN1K))上训练深度神经网络的问题,使其既在该训练任务上表现出色,又能在其他(未来)迁移任务上表现出色。这两个看似矛盾的特性在提升模型泛化能力与保持其原任务性能之间施加了一种权衡。采用自监督学习训练的模型在迁移学习上往往比有监督对应模型泛化更好;然而,它们在 IN1K 上仍落后于有监督模型。在本文中,我们提出一种有监督学习设置,兼具两者之长。我们广泛分析了使用多尺度裁剪进行数据增强以及可舍弃投影头的有监督训练,并揭示投影头的设计使我们能够控制训练任务性能与可迁移性之间的权衡。我们进一步用通过记忆库即时计算的类原型替换最后一层类权重,并推导出两个模型:t-ReX 在迁移学习上达到新的 state of the art,并在 IN1K 上优于 DINO 和 PAWS 等顶级方法;以及 t-ReX* 在 IN1K 上与高度优化的 RSB-A1 模型相匹配,同时在迁移任务上表现更好。代码与预训练模型:https://europe.naverlabs.com/t-rex
引用
@article{arxiv.2206.15369,
title = {No Reason for No Supervision: Improved Generalization in Supervised Models},
author = {Mert Bulent Sariyildiz and Yannis Kalantidis and Karteek Alahari and Diane Larlus},
journal= {arXiv preprint arXiv:2206.15369},
year = {2023}
}
备注
Accepted to ICLR 2023 (spotlight)