分布外泛化评估综述
机器学习
2024-03-05 v1
摘要
机器学习模型虽然逐步先进,但严重依赖独立同分布假设,而该假设在实践中因不可避免的分布偏移而常常无法满足。这使得它们在风险敏感应用中的部署变得脆弱且不可信。这一重要问题因此催生了多个分支的工作,致力于开发能够实现分布外(OOD)泛化的算法。尽管有这些努力,但对OOD泛化评估的关注却少得多,而评估本身也是一个复杂且基础的问题。其目标不仅是评估模型的OOD泛化能力是否强大,还要评估模型在哪些地方泛化得好或差。这需要刻画模型能够有效处理的分布偏移类型,并识别给定模型的安全和风险输入区域。本文首次对OOD评估进行了全面综述。我们根据测试数据的可用性,将现有研究分为三个范式:OOD性能测试、OOD性能预测和OOD内在属性刻画。此外,我们简要讨论了预训练模型背景下的OOD评估。最后,我们提出了OOD评估未来研究的几个有前景的方向。
引用
@article{arxiv.2403.01874,
title = {A Survey on Evaluation of Out-of-Distribution Generalization},
author = {Han Yu and Jiashuo Liu and Xingxuan Zhang and Jiayun Wu and Peng Cui},
journal= {arXiv preprint arXiv:2403.01874},
year = {2024}
}