中文

分布外数据的价值

机器学习 2023-07-20 v5 人工智能 计算机视觉与模式识别 机器学习

摘要

我们期望随着来自相似任务的样本增多,泛化误差会改善;而随着来自分布外(OOD)任务的样本增多,泛化误差会恶化。本工作中,我们展示了一个反直觉现象:任务的泛化误差可以是OOD样本数量的非单调函数。随着OOD样本数增加,目标任务的泛化误差先改善,超过某一阈值后才恶化。换言之,在少量OOD数据上训练是有价值的。我们使用合成数据集上的Fisher线性判别,以及计算机视觉基准(如MNIST、CIFAR-10、CINIC-10、PACS和DomainNet)上的深度网络来展示并分析该现象。在已知哪些样本为OOD的理想设定下,我们展示了可利用目标与OOD经验风险的适当加权目标来利用这些非单调趋势。尽管其实用性有限,但这表明若能检测OOD样本,则可能存在从中获益的方法。当我们不知哪些样本为OOD时,我们展示了数据增强、超参数优化和预训练等若干常用策略不足以确保目标泛化误差不随数据集中OOD样本数增多而恶化。

关键词

引用

@article{arxiv.2208.10967,
  title  = {The Value of Out-of-Distribution Data},
  author = {Ashwin De Silva and Rahul Ramesh and Carey E. Priebe and Pratik Chaudhari and Joshua T. Vogelstein},
  journal= {arXiv preprint arXiv:2208.10967},
  year   = {2023}
}

备注

Previous versions of this work have been presented at the Out-of-Distribution Generalization in Computer Vision (OOD-CV) Workshop (ECCV 2022) and the Workshop on Distribution Shifts (NeurIPS 2022)