勿归咎于数据集偏移!由梯度与交叉熵导致的捷径学习
机器学习
2023-08-25 v1 机器学习
摘要
对捷径学习的常见解释假定:捷径在训练分布下改善预测,而在测试分布下不然。因此,通过典型基于梯度的交叉熵优化(我们称为default-ERM)训练的模型会利用捷径。然而,即便在训练分布中由稳定特征决定标签、且捷径不提供任何额外信息(如感知任务中)时,default-ERM仍表现出捷径学习。当仅用稳定特征便可将default-ERM的损失降为零时,为何偏好此类解?通过研究一个线性感知任务,我们表明:default-ERM对最大化间隔的偏好导致模型比稳定特征更依赖捷径,即便无过参数化亦然。该洞见表明,default-ERM面向最大间隔的隐式归纳偏置不适用于感知任务。相反,我们开发了面向均匀间隔的归纳偏置,并证明该偏置在线性感知任务中保证仅依赖完美的稳定特征。我们开发了鼓励均匀间隔解的损失函数,称为间隔控制(MARG-CTRL)。MARG-CTRL在多种视觉与语言任务上缓解了捷径学习,表明更好的归纳偏置可消除感知任务中昂贵的二阶捷径缓解方法之需。
引用
@article{arxiv.2308.12553,
title = {Don't blame Dataset Shift! Shortcut Learning due to Gradients and Cross Entropy},
author = {Aahlad Puli and Lily Zhang and Yoav Wald and Rajesh Ranganath},
journal= {arXiv preprint arXiv:2308.12553},
year = {2023}
}