基于最优传输的表格异常检测校准
机器学习
2026-05-07 v2
摘要
表格异常检测(TAD)由于表格数据的异质性而 remains 挑战:特征缺乏自然关系,分布和尺度差异很大,且呈现多种类型。因此,每个TAD方法都对异常模式做出隐式假设,这些假设在某些数据集上表现良好,但在其他数据集上则失败,没有任何方法在各种场景中都能 consistently 优于他人。我们提出了CTAD(Calibrating Tabular Anomaly Detection),这是一种模型中性的后处理框架,通过样本特定校准来增强任何现有的TAD检测器。我们的ethods通过两种互补分布来特征化正常数据,即来自随机抽样的经验分布和来自K-means质心的结构分布,并测量将测试样本添加到两者中的兼容性破坏程度。正常样本保持低破坏,而异常样本导致高破坏,为放大检测提供校准信号。我们证明了最优传输距离的一个下界,其比例为测试样本距离于质心的距离,并且证明了在期望情况下,异常样本系统性地接收更高的校准得分 than 正常样本,这解释了该方法为何能够跨数据集推广。广泛的实验在34个多样化的表格数据集上进行,涵盖7个代表性检测器,覆盖TAD的所有主要类别(密度估计、分类、重建和隔离方法),结果表明CTAD在统计意义上 consistently 改善了性能。令人惊讶的是,CTAD即使可以提升最先进的深度学习方法,还能在 diverse 的超参数设置下保持稳健的性能,不需要额外的调参即可用于实际部署。
引用
@article{arxiv.2602.06810,
title = {Calibrating Tabular Anomaly Detection via Optimal Transport},
author = {Hangting Ye and He Zhao and Wei Fan and Xiaozhuang Song and Dandan Guo and Yi Chang and Hongyuan Zha},
journal= {arXiv preprint arXiv:2602.06810},
year = {2026}
}