中文

HALO:基于联合优化的鲁棒分布外检测

机器学习 2025-02-28 v1 密码学与安全

摘要

有效的分布外(OOD)检测对于在现实场景中安全部署机器学习模型至关重要。然而,近期研究表明,OOD 检测方法易受到对抗攻击的威胁,可能导致在高风险应用中出现严重故障。这一发现促使人们发展能够在各种攻击设置下维持性能的鲁棒 OOD 检测方法。以往方法虽已在此问题上取得进展,但存在诸多局限性:要么仅对 OOD 数据上的攻击表现出鲁棒性,要么未能保持强大的干净性能。在本工作中,我们采用现有的鲁棒分类框架 TRADES,将其扩展到鲁棒 OOD 检测问题,并发现一种新的目标函数。鉴于干净/鲁棒权衡对 OOD 检测至关重要,我们引入额外的损失项,以提升分类和检测性能。我们称之为 HALO(Helper-based AdversariaL OOD detection),该方法超越了现有方法,在多个数据集和攻击设置下实现最先进的性能。大量实验表明,与下一最佳方法相比,在干净设置下的平均 AUROC 提升 3.15,在对抗攻击下的提升为 7.07。此外,HALO 能抵抗转移攻击,可通过 hyperparameter 选择实现可调性能,兼容现有的 OOD 检测框架,为未来的性能提升留下了可能性。代码已公开:https://github.com/hugo0076/HALO

关键词

引用

@article{arxiv.2502.19755,
  title  = {HALO: Robust Out-of-Distribution Detection via Joint Optimisation},
  author = {Hugo Lyons Keenan and Sarah Erfani and Christopher Leckie},
  journal= {arXiv preprint arXiv:2502.19755},
  year   = {2025}
}

备注

SaTML 2025