数据高效且可解释的表格异常检测
机器学习
2023-06-06 v2
摘要
异常检测(AD)在众多应用中发挥着重要作用。我们关注 AD 的两个未被充分研究但对集成到实际应用至关重要的方面。首先,大多数 AD 方法无法利用实践中常少量存在的标注数据,而这些数据对实现高 AD 精度可能至关重要。其次,大多数 AD 方法不可解释,这一瓶颈阻碍了利益相关者理解异常背后的原因。本文提出一种新颖的 AD 框架,其将白盒模型类——广义加性模型——适配于使用部分识别目标检测异常,该目标可自然处理含噪或异构特征。此外,所提框架 DIAD 可利用少量标注数据,在半监督设定下进一步提升异常检测性能。我们使用多种表格数据集,在无监督与半监督设定下均证明了该框架相较先前工作的优越性。例如,在 5 个标注异常下,DIAD 通过从非标注数据学习 AD,将 AUC 从 86.2% 提升至 89.4%。我们还给出了阐释性解释,说明 DIAD 为何将某些样本判定为异常。
引用
@article{arxiv.2203.02034,
title = {Data-Efficient and Interpretable Tabular Anomaly Detection},
author = {Chun-Hao Chang and Jinsung Yoon and Sercan Arik and Madeleine Udell and Tomas Pfister},
journal= {arXiv preprint arXiv:2203.02034},
year = {2023}
}
备注
Accepted in 2023 KDD