中文

混合训练数据无法确保分布外泛化

机器学习 2024-04-24 v4

摘要

深度神经网络在处理分布外(OOD)数据时常常面临泛化问题,并且在影响因素及其各自影响之间仍然存在显著的理论空白。来自分布内数据的文献证据表明,如果增加混合训练数据的大小,泛化误差可以缩小。然而,当涉及OOD样本时,这种传统理解不再成立——增加训练数据的大小并不总是导致测试泛化误差的减少。事实上,在各种偏移场景中发现了误差的多样化趋势,包括幂律模式下的递减趋势、先降后升的趋势,或持续稳定的趋势。以往的工作定性地处理OOD数据,仅将其视为训练中未见过的样本,这难以解释复杂的非单调趋势。在这项工作中,我们定量地将OOD数据重新定义为位于混合训练数据凸包之外的数据,并建立了新的泛化误差界以更好地理解这些反直觉的观察结果。我们对新风险界的证明表明,对于凸包内的未见数据,训练良好的模型的有效性可以得到保证;更有趣的是,对于超出此覆盖范围的OOD数据,无法确保泛化,这与我们的观察结果一致。此外,我们尝试了各种OOD技术,以强调我们的结果不仅解释了近期OOD泛化工作中富有洞察力的观察结果,例如多样化数据的重要性以及现有算法对未见偏移的敏感性,而且还启发了一种新颖且有效的数据选择策略。

关键词

引用

@article{arxiv.2312.16243,
  title  = {Mixture Data for Training Cannot Ensure Out-of-distribution Generalization},
  author = {Songming Zhang and Yuxiao Luo and Qizhou Wang and Haoang Chi and Xiaofeng Chen and Bo Han and Jinyan Li},
  journal= {arXiv preprint arXiv:2312.16243},
  year   = {2024}
}

备注

13 pages, 9 figures