LoD:通过刻意标签污化无标注野生数据实现损失差异离群分布检测
机器学习
2025-05-20 v1 机器学习
摘要
近期广泛关注利用包含旁近分布(in-distribution, ID)与离群分布(out-of-distribution, OOD)数据的无标注野生数据,以提升模型的安全性与可靠性。现有方法要么设计针对标注ID数据与无标注野生数据的定制化损失函数后进行联合优化,要么先筛选出后者中的OD数据再学习OD检测器。尽管取得不同程度的成功,但仍存在两个潜在问题:(i)标注ID数据通常主导模型学习,导致模型倾向于拟合OD数据为ID;(ii)针对无标注野生数据中OD数据筛选的阈值选择往往面临困境,因缺乏纯粹的OD样本。为此,我们提出一种新型损失差异OD检测框架(Loss-difference OOD detection, LoD),通过\textit{刻意标签污化}无标注野生数据。此操作不仅使标注ID数据与无标注野生数据中的OD数据共同主导模型学习,还确保ID与OD样本在无标注野生数据中的损失具有可区分性,从而允许经典聚类技术(如K-means)在无需阈值的前提下筛选这些OD样本。我们还提供LoD可行性的理论依据,广泛实验验证其优越性。
引用
@article{arxiv.2505.12952,
title = {LoD: Loss-difference OOD Detection by Intentionally Label-Noisifying Unlabeled Wild Data},
author = {Chuanxing Geng and Qifei Li and Xinrui Wang and Dong Liang and Songcan Chen and Pong C. Yuen},
journal= {arXiv preprint arXiv:2505.12952},
year = {2025}
}
备注
Accepted by IJCAI2025