SCOD:从启发式到理论
机器学习
2024-03-26 v1 机器学习
摘要
本文探讨了设计可靠预测模型的问题,该模型在面临不确定或分布外样本时放弃预测——这是一个最近提出的问题,称为存在分布外数据情况下的选择性分类(SCOD)。我们对 SCOD 做出了三项关键贡献。首先,我们证明了最优 SCOD 策略涉及一个用于分布内(ID)数据的 Bayes 分类器和一个在二维空间中表示为随机线性分类器的选择器,该选择器使用 i) ID 分类器的条件风险,和 ii) ID 和分布外(OOD)数据的似然比作为输入。这与当前 OOD 检测方法的次优策略以及专门为 SCOD 开发的 Softmax 信息保留组合(SIRC)形成对比。其次,我们确立了在无分布设置下,当仅依赖 ID 数据样本时,SCOD 问题不是 Probably Approximately Correct 可学习的。第三,我们引入了 POSCOD,这是一种从 ID 数据样本以及 ID 和 OOD 数据的无标签混合中学习最优 SCOD 策略的插件估计的简单方法。我们的实证结果证实了理论发现,并证明了我们提出的方法 POSCOD 在有效解决 SCOD 问题方面优于现有的 OOD 方法。
引用
@article{arxiv.2403.16916,
title = {SCOD: From Heuristics to Theory},
author = {Vojtech Franc and Jakub Paplham and Daniel Prusa},
journal= {arXiv preprint arXiv:2403.16916},
year = {2024}
}