中文

利用人类反馈抑制分布外检测中的假阳性

机器学习 2024-04-29 v1 人工智能 机器学习

摘要

对分布外(OOD)样本的鲁棒性对于在开放世界中安全部署机器学习模型至关重要。最近的工作集中在设计评分函数以量化 OOD 不确定性。为这些评分函数设定适当的阈值以进行 OOD 检测具有挑战性,因为 OOD 样本通常无法预先获取。通常,阈值被设定为实现期望的真阳性率(TPR),例如 95%95\% TPR。然而,正如 Open-OOD 基准中所观察到的那样,这可能导致非常高的假阳性率(FPR),范围在 60 到 96\% 之间。在医疗诊断等安全关键的实际应用中,在动态处理各种 OOD 样本时控制 FPR 是必不可少的。为了应对这些挑战,我们提出了一个数学上有根据的 OOD 检测框架,该框架利用专家反馈来安全地实时更新阈值。我们提供的理论结果表明,它保证在任何时候都能满足 FPR 约束,同时最小化人类反馈的使用。我们框架的另一个关键特征是它可以与任何用于 OOD 不确定性量化的评分函数一起工作。我们在合成和基准 OOD 数据集上对系统进行的实证评估表明,我们的方法可以在最大化 TPR 的同时将 FPR 保持在最多 5%5\%

关键词

引用

@article{arxiv.2404.16954,
  title  = {Taming False Positives in Out-of-Distribution Detection with Human Feedback},
  author = {Harit Vishwakarma and Heguang Lin and Ramya Korlakai Vinayak},
  journal= {arXiv preprint arXiv:2404.16954},
  year   = {2024}
}

备注

Appeared in the 27th International Conference on Artificial Intelligence and Statistics (AISTATS 2024)