没有一种表征能统治一切:训练方法的重叠特征
机器学习
2022-04-27 v3
摘要
尽管能够捕捉数据的一系列特征,但经监督训练的高准确率模型往往做出相似的预测。这似乎意味着高性能模型无论训练方法如何都共享相似的偏置,这将限制集成收益并使低准确率模型几乎无实际用途。在此背景下,近期工作开发了颇为不同的训练技术,如大规模对比学习,在泛化与鲁棒性基准上取得了具竞争力的高准确率。这促使我们重新审视模型必然学习相似函数的假设。我们对跨超参数、架构、框架与数据集的模型进行了大规模实证研究。我们发现,在训练方法上分歧更大的模型对表现出根本不同的泛化行为,产生愈发不相关的误差。我们表明这些模型专精于数据的子域,从而带来更高的集成性能:仅用 2 个模型(每个在 ImageNet 上准确率约 76.5%),我们可构建准确率达 83.4%(+7% 提升)的集成。令人惊讶的是,我们发现即便显著低准确率的模型也可用于改进高准确率模型。最后,我们表明分歧的训练方法产生的表征捕捉了重叠(但非包含)的特征集,这些特征集结合后可提升下游性能。
引用
@article{arxiv.2110.12899,
title = {No One Representation to Rule Them All: Overlapping Features of Training Methods},
author = {Raphael Gontijo-Lopes and Yann Dauphin and Ekin D. Cubuk},
journal= {arXiv preprint arXiv:2110.12899},
year = {2022}
}