中文

基于人类反馈的自适应评分与阈值设定用于鲁棒的分布外检测

机器学习 2025-05-06 v1 人工智能

摘要

机器学习模型在分布内数据上训练,但在部署时经常遇到分布外输入——这在安全关键领域构成了严重风险。近期的工作侧重于设计评分函数来量化分布外不确定性,其分数阈值通常仅基于分布内数据设定,以达到目标真阳性率,因为分布外数据在部署前是有限的。然而,这些基于真阳性率的阈值使得假阳性率不受控制,常常导致高假阳性率,即分布外点被误分类为分布内。此外,固定的评分函数和阈值缺乏处理新观察到的、不断演变的分布外输入所需的自适应性,导致性能次优。为了解决这些挑战,我们提出了一个人在回路框架,该框架基于真实世界的分布外输入,\textit{安全地动态更新评分函数和阈值}。我们的方法在最大化真阳性率的同时,始终严格控制假阳性率,即使系统随时间自适应也是如此。我们为平稳条件下的假阳性率控制提供了理论保证,并在OpenOOD基准上进行了广泛的实证评估,证明我们的方法通过实现更高的真阳性率同时保持假阳性率控制,优于现有方法。

关键词

引用

@article{arxiv.2505.02299,
  title  = {Adaptive Scoring and Thresholding with Human Feedback for Robust Out-of-Distribution Detection},
  author = {Daisuke Yamada and Harit Vishwakarma and Ramya Korlakai Vinayak},
  journal= {arXiv preprint arXiv:2505.02299},
  year   = {2025}
}