稀有异常需要大数据集:关于证明异常存在性的论述
机器学习
2025-08-14 v1 人工智能
摘要
检测数据集中是否存在异常现象对于有效的异常检测至关重要,然而这一问题在异常检测文献中仍显得不够关注。本文提出了一项全面的研究,旨在回答基本问题:何时才能确切地确定是否存在异常?通过涉及数百万项统计测试的广泛实验,我们在各种异常检测任务和算法之间识别出数据集大小、污染率与算法相关常数 之间的关系。我们的结果表明,对于大小为 、污染率为 的无标签数据集,满足 的条件代表了确认异常存在所需样本数的下界。该阈值意味着,在证明异常存在性之前,异常的稀有程度受到限制。
引用
@article{arxiv.2508.09894,
title = {Rare anomalies require large datasets: About proving the existence of anomalies},
author = {Simon Klüttermann and Emmanuel Müller},
journal= {arXiv preprint arXiv:2508.09894},
year = {2025}
}
备注
13 pages, 8 figures