中文

利用分布外数据去除不良特征贡献

机器学习 2021-11-23 v3 计算机视觉与模式识别

摘要

若干数据增强方法部署未标注的分布内(UID)数据以弥合神经网络的训练与推理之间的差距。然而,这些方法在 UID 数据的可用性以及算法对伪标签的依赖性方面存在明显局限。在此,我们提出一种数据增强方法,通过使用不存在上述问题的分布外(OOD)数据,在对抗学习和标准学习中均改善泛化能力。我们展示了在每个学习场景中如何理论上利用 OOD 数据改善泛化,并以 CIFAR-10、CIFAR-100 和 ImageNet 的一个子集上的实验补充了我们的理论分析。结果表明,即使从人类视角看似几乎无关联的图像数据之间也共享不良特征。我们还通过与其它数据增强方法的比较展示了所提方法的优势,这些方法可在缺少 UID 数据时使用的。此外,我们证明了所提方法能进一步改进现有的当前最优对抗训练。

关键词

引用

@article{arxiv.2101.06639,
  title  = {Removing Undesirable Feature Contributions Using Out-of-Distribution Data},
  author = {Saehyung Lee and Changhwa Park and Hyungyu Lee and Jihun Yi and Jonghyun Lee and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2101.06639},
  year   = {2021}
}

备注

Published as a conference paper at ICLR 2021