中文

受限访问环境中检测分布外样本的扰动与比较方法

机器学习 2024-08-20 v1 人工智能 机器学习

摘要

通过远程API访问机器学习模型在最近扩大模型参数以提高性能的趋势之后已变得越来越普遍。尽管这些模型表现出显著的能力,但检测分布外(OOD)样本仍然是终端用户的一个关键安全问题,因为这些样本可能导致模型产生不可靠的输出。在这项工作中,我们提出了一个OOD检测框架MixDiff,即使模型的参数或其激活对终端用户不可访问时也适用。为了绕过访问限制,MixDiff对给定的目标样本和类似的分布内(ID)样本施加相同的输入级扰动,然后比较这两个样本的模型输出之间的相对差异。MixDiff是模型无关的,并与现有的基于输出的OOD检测方法兼容。我们提供了理论分析来说明MixDiff在辨别导致模型过度自信输出的OOD样本方面的有效性,并通过实证证明MixDiff在视觉和文本领域的各种数据集上持续提升了OOD检测性能。

关键词

引用

@article{arxiv.2408.10107,
  title  = {Perturb-and-Compare Approach for Detecting Out-of-Distribution Samples in Constrained Access Environments},
  author = {Heeyoung Lee and Hoyoon Byun and Changdae Oh and JinYeong Bak and Kyungwoo Song},
  journal= {arXiv preprint arXiv:2408.10107},
  year   = {2024}
}

备注

Accepted to European Conference on Artificial Intelligence (ECAI) 2024