中文

针对受污染训练数据的异常检测:自适应与积极的拒绝机制

机器学习 2025-11-27 v1 人工智能

摘要

处理受污染数据是异常检测中的关键挑战,因为传统模型假设在纯净正常数据上进行训练。常规方法通过依赖固定污染比例来缓解污染,但假设与实际比例之间的差异会在数据分布重叠的噪声环境中严重降低性能。为此,我们提出自适应和积极拒绝 (AAR),一种新方法,通过修改 z 分数和基于高斯混合模型的阈值动态排除异常值。AAR 通过集成硬拒绝和软拒绝策略,有效平衡了保留正常数据与排除异常值之间的权衡。在两个图像数据集和三十个表格数据集上的大量实验表明,AAR 超越当前最先进方法 0.041 AUROC。通过提供可扩展且可靠的解决方案,AAR 增强了对受污染数据集的鲁棒性,为安全和医疗等领域的广泛实际应用铺平了道路。

关键词

引用

@article{arxiv.2511.21378,
  title  = {Anomaly Detection with Adaptive and Aggressive Rejection for Contaminated Training Data},
  author = {Jungi Lee and Jungkwon Kim and Chi Zhang and Kwangsun Yoo and Seok-Joo Byun},
  journal= {arXiv preprint arXiv:2511.21378},
  year   = {2025}
}