一种关于无标签数据在异常分布检测中的中位数视角
机器学习
2025-10-09 v1 人工智能
最优化与控制
机器学习
摘要
异常分布(OOD)检测在确保机器学习系统在实际应用中稳健可靠方面发挥着关键作用。最近的研究方法探索了使用无标签数据的潜力,显示出增强OOD检测能力的可能性。然而,有效利用野外无标签数据仍具有挑战性,因为这些数据包含InD和OOD样本的混合特性。缺乏明确的OOD样本集合 complicates 训练最优OOD分类器的任务。在本工作中,我们引入Medix—a一种新型框架,用于使用中位数操作识别潜在离群值。我们之所以使用中位数,是因为它提供了稳定的集中趋势估计,由于其对噪声和离群值的鲁棒性,充当OD检测机制。使用这些被识别的离群值以及标记的InD数据,我们训练了一个稳健的OD分类器。从理论角度看,我们推导了错误上界,表明Medix实现了较低的错误率。实证结果进一步 substantiate我们的主张,Medix在开放式环境中全面超越现有方法,确认了我们理论洞见的有效性。
引用
@article{arxiv.2510.06505,
title = {A Median Perspective on Unlabeled Data for Out-of-Distribution Detection},
author = {Momin Abbas and Ali Falahati and Hossein Goli and Mohammad Mohammadi Amiri},
journal= {arXiv preprint arXiv:2510.06505},
year = {2025}
}