打地鼠困境:捷径多重涌现,缓解其一反而放大其余
计算机视觉与模式识别
2023-03-22 v2
摘要
机器学习模型被发现会学习捷径——无法泛化的非预期决策规则——损害模型的可靠性。先前工作在仅有单一捷径存在于训练数据中的脆弱假设下解决该问题。真实世界图像充斥着从背景到纹理的多种视觉线索。推进视觉系统可靠性的关键在于理解现有方法能否克服多重捷径,抑或陷入打地鼠游戏,即缓解一个捷径会放大对其他捷径的依赖。为弥补这一不足,我们提出两个基准:1) UrbanCars,一个具有精确控制伪线索的数据集;2) ImageNet-W,一个基于 ImageNet 的评估集,用于水印这一我们发现影响几乎每个现代视觉模型的捷径。结合纹理与背景,ImageNet-W 使我们能研究从自然图像训练中涌现的多重捷径。我们发现计算机视觉模型,包括大型基础模型——无论训练集、架构与监督方式——在多重捷径存在时均表现不佳。即便是专门设计用于对抗捷径的方法也陷入打地鼠困境。为应对该挑战,我们提出末层集成(Last Layer Ensemble),一种简单而有效、无打地鼠行为地缓解多重捷径的方法。我们的结果将多捷径缓解凸显为被忽视的、对推进视觉系统可靠性至关重要的挑战。数据集与代码已发布:https://github.com/facebookresearch/Whac-A-Mole。
引用
@article{arxiv.2212.04825,
title = {A Whac-A-Mole Dilemma: Shortcuts Come in Multiples Where Mitigating One Amplifies Others},
author = {Zhiheng Li and Ivan Evtimov and Albert Gordo and Caner Hazirbas and Tal Hassner and Cristian Canton Ferrer and Chenliang Xu and Mark Ibrahim},
journal= {arXiv preprint arXiv:2212.04825},
year = {2023}
}
备注
CVPR 2023. Code is available at https://github.com/facebookresearch/Whac-A-Mole