处理分布外数据:综述
机器学习
2025-07-30 v1 人工智能
摘要
在机器学习(ML)和数据驱动应用领域,一个重大挑战是训练和部署阶段之间数据分布的变化,通常称为分布偏移。本文概述了处理两种主要分布偏移类型的不同机制:(i) 协变量偏移:特征或协变量的值在训练数据和测试数据之间发生变化,以及 (ii) 概念/语义偏移:由于测试阶段出现新类别,模型在训练期间学习到的概念发生偏移。我们将贡献总结为三个方面。首先,我们形式化分布偏移,阐述传统方法为何无法充分处理它们,并呼吁建立一个能够在所有类型的分布偏移中同时表现更好的模型。其次,我们讨论处理分布偏移的重要性,并对已开发的用于检测、测量和减轻这些偏移影响的方法和技术进行广泛回顾。第三,我们讨论分布偏移处理机制的现状,并提出该领域的未来研究方向。总体而言,我们提供了分布偏移文献的回顾性概要,重点关注现有调查中忽视的OOD数据。
引用
@article{arxiv.2507.21160,
title = {Handling Out-of-Distribution Data: A Survey},
author = {Lakpa Tamang and Mohamed Reda Bouadjenek and Richard Dazeley and Sunil Aryal},
journal= {arXiv preprint arXiv:2507.21160},
year = {2025}
}
备注
20 pages, 6 figures, 6 tables. Accepted at IEEE Transactions on Knowledge and Data Engineering