过于完美而不真实的先验以减少捷径依赖
计算机视觉与模式识别
2021-10-22 v3 机器学习
摘要
尽管深度网络在标准测试条件下的目标识别及其他任务中表现优异,但它们常常无法泛化到分布外(o.o.d.)样本。这一缺陷的一个原因是现代架构倾向于依赖“捷径”——与类别相关但未捕捉跨上下文成立的更深层不变量的表层特征。真实世界概念通常具有复杂结构,可在不同上下文中表层地变化,这可能使在某一上下文中最直观且最有前景的解无法泛化到其他上下文。改善 o.o.d. 泛化的一种潜在方法是假设简单解不太可能跨上下文有效并加以避免,我们称之为过于完美而不真实的先验。具有浅层架构的低容量网络(LCN)应只能学习表层关系,包括捷径。我们发现 LCN 可用作捷径检测器。此外,LCN 的预测可用于一种两阶段方法,以鼓励高容量网络(HCN)依赖应广泛泛化的更深层不变特征。具体而言,在训练 HCN 时,对 LCN 能掌握的样本进行降权。使用我们引入了捷径的修改版 CIFAR-10 数据集,我们发现两阶段 LCN-HCN 方法减少了对捷径的依赖并促进了 o.o.d. 泛化。
引用
@article{arxiv.2102.06406,
title = {A Too-Good-to-be-True Prior to Reduce Shortcut Reliance},
author = {Nikolay Dagaev and Brett D. Roads and Xiaoliang Luo and Daniel N. Barry and Kaustubh R. Patil and Bradley C. Love},
journal= {arXiv preprint arXiv:2102.06406},
year = {2021}
}
备注
10 pages, 8 figures