一种基于证据的数据污染下异常检测的事后调整框架
机器学习
2026-01-30 v2
摘要
无监督异常检测方法通常假设训练数据是干净的,然而现实世界的数据集常常包含未被检测到或被错误标记的异常,导致性能显著下降。现有的解决方案需要访问训练流程、数据或数据中异常比例的先验知识,限制了它们在现实世界中的适用性。为了应对这一挑战,我们提出了EPHAD,一个简单而有效的测试时自适应框架,它利用测试时收集的证据来更新在受污染数据集上训练的AD模型的输出。我们的方法将受污染数据集上训练的AD模型捕获的先验知识与来自多模态基础模型(如对比语言-图像预训练)、经典AD方法(如局部异常因子)或领域特定知识的证据相结合。我们使用一个合成的玩具示例说明了EPHAD背后的直觉,并通过在八个视觉AD数据集、二十六个表格AD数据集和一个真实世界的工业AD数据集上的全面实验验证了其有效性。此外,我们进行了一项消融研究,以分析超参数的影响和对不同污染水平的鲁棒性,证明了EPHAD在不同AD模型和证据对上的多功能性和鲁棒性。为确保可重复性,我们的代码公开于https://github.com/sukanyapatra1997/EPHAD。
引用
@article{arxiv.2510.21296,
title = {An Evidence-Based Post-Hoc Adjustment Framework for Anomaly Detection Under Data Contamination},
author = {Sukanya Patra and Souhaib Ben Taieb},
journal= {arXiv preprint arXiv:2510.21296},
year = {2026}
}
备注
Accepted in the Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)