只需一个好的嵌入提取器即可修复虚假相关性
计算机视觉与模式识别
2022-12-14 v1 机器学习
摘要
训练数据中的虚假相关性常导致鲁棒性问题,因为模型学会将它们用作捷径。例如,在预测一个物体是否为牛时,模型可能学会依赖其绿色背景,因此在沙地背景上的牛上表现很差。衡量缓解该问题方法的最先进水准的标准数据集是 Waterbirds。目前最佳方法(分组分布鲁棒优化——GroupDRO)达到了 89% 的最差组准确率,而仅在原始图像上从头开始的标准训练仅得 72%。GroupDRO 需要使用子组标签以端到端方式训练模型。在本文中,我们表明,通过简单地使用大型预训练视觉模型提取器的嵌入并在其上训练一个线性分类器,无需使用训练集中的任何子组信息即可达到高达 90% 的准确率。通过对广泛预训练模型和预训练数据集的实验,我们表明预训练模型的容量和预训练数据集的大小至关重要。我们的实验揭示,高容量视觉 transformer 相比高容量卷积神经网络表现更好,且更大的预训练数据集带来虚假相关性数据集上更好的最差组准确率。
引用
@article{arxiv.2212.06254,
title = {You Only Need a Good Embeddings Extractor to Fix Spurious Correlations},
author = {Raghav Mehta and Vítor Albiero and Li Chen and Ivan Evtimov and Tamar Glaser and Zhiheng Li and Tal Hassner},
journal= {arXiv preprint arXiv:2212.06254},
year = {2022}
}
备注
Accepted at ECCV 2022 workshop on Responsible Computer Vision (RCV)