基于伪标签引导的表格异常检测提升方法
人工智能
2026-04-21 v1
摘要
识别表格数据中的异常实例对于提高数据可靠性和维护系统稳定性至关重要。由于缺乏真实的异常标签,现有方法主要依赖无监督异常检测模型,或利用少量标记的异常样本通过生成或对比学习来促进检测。然而,无监督方法缺乏足够的异常意识,而当前的生成和对比方法倾向于全局计算异常,忽略了表格特征的局部异常模式,导致检测性能 suboptimal。为解决这些限制,我们提出了 PLAG(伪标签引导的异常生成方法),旨在增强表格异常检测。具体而言,通过利用伪异常作为指导信号并将样本的整体异常量化解耦为特征层次异常的累积,PLAG 不仅有效地消除了对稀缺真实标签的需求,还为模型在细粒度水平上理解局部异常信号提供了新的视角。此外,提出了两阶段数据选择策略,将格式验证和不确定性估计整合,以严格筛选候选样本,从而确保合成异常的忠实性和多样性。最终,这些被筛选的合成异常作为强大的判别性指导,使模型能够更好地区分正常和异常实例。广泛的实验表明,PLAG 在八个代表性基准方法上实现了最先进的性能。而且,作为一个灵活的框架,PLAG 可以无缝集成到现有的无监督检测器中,持续将 F1 分数提升 0.08 至 0.21。
引用
@article{arxiv.2604.18266,
title = {Enhancing Tabular Anomaly Detection via Pseudo-Label-Guided Generation},
author = {Wei Huang and Yuxuan Xiong and Hezhe Qiao and Yu-Ming Shang and Xiangling Fu and Guansong Pang},
journal= {arXiv preprint arXiv:2604.18266},
year = {2026}
}
备注
13 pages, 6 figures