phepy:分布外检测器的可视化基准与改进
机器学习
2025-03-10 v1
摘要
将机器学习应用于日益高维且训练数据稀疏或有偏的问题,会增加模型在其训练域外输入上被使用的风险。对于此类分布外(OOD)输入,模型无法做出有效预测,其误差可能无界。在真实数据集上测试 OOD 检测方法因哪些输入属于分布内(ID)或分布外(OOD)的模糊性而变得复杂。我们设计了一个 OOD 检测基准,包含三个新颖且易于可视化的玩具示例。这些简单示例提供了直接的直观洞察,用于判断检测器是否能够检测(1)线性概念和(2)非线性概念,以及(3)在高维空间(干草堆)中识别狭义的 ID 子空间(针)。我们使用该基准评估了文献中各种方法的性能。由于 OOD 输入的触觉示例可能有助于 OOD 检测,我们还回顾了多种用于监督训练的合成 OOD 输入的简单方法。我们引入了两种改进——-探测和 OOD 样本加权——以使监督检测器在 ID-OOD 边界处更加精确。这在真实 ID 与合成 OOD 样本之间的冲突模糊决策边界时尤为重要。最后,我们提供了在机器学习中构建和应用分布外检测器的建议。
引用
@article{arxiv.2503.05169,
title = {phepy: Visual Benchmarks and Improvements for Out-of-Distribution Detectors},
author = {Juniper Tyree and Andreas Rupp and Petri S. Clusius and Michael H. Boy},
journal= {arXiv preprint arXiv:2503.05169},
year = {2025}
}