无标签数据如何在实际分布检测中发挥作用?
机器学习
2024-02-07 v1 机器学习
摘要
使用无标签数据来正则化机器学习模型已显示出通过提高检测实际分布外(OOD)数据的安全性和可靠性具有前景的潜力。由于来自实际环境中无标签数据的异质性(包括来自实际分布内(ID)和 OOD 数据),充分利用这些数据的力量并不容易。缺乏干净的 OOD 样本集为学习最优 OOD 分类器提出了重大挑战。目前缺乏对无标签数据如何帮助 OOD 检测进行形式化理解的研究。本文通过引入新的学习框架 SAL(Separate And Learn)来弥合这一差距,该框架提供了强大的理论保证和实证有效性。该框架将来自无标签数据中潜在的离群点分离出来,然后使用这些候选离群点和标记的 ID 数据训练 OOD 分类器。理论上,我们从可分离性和可学习性的角度提供了严格的误差界,正式论证了算法中的两个组件。我们的理论表明,SAL 能够以较小的误差率分离候选离群点,从而为所学 OOD 分类器提供了泛化保证。实证上,SAL 在常见基准测试上实现了最先进的性能,强化了我们的理论见解。代码已公开 disponible at https://github.com/deeplearning-wisc/sal。
引用
@article{arxiv.2402.03502,
title = {How Does Unlabeled Data Provably Help Out-of-Distribution Detection?},
author = {Xuefeng Du and Zhen Fang and Ilias Diakonikolas and Yixuan Li},
journal= {arXiv preprint arXiv:2402.03502},
year = {2024}
}
备注
ICLR 2024