中文

用于审计数据无监督异常检测及类别编码影响的研究

机器学习 2022-10-27 v2 人工智能

摘要

本文引入 Vehicle Claims 数据集,由汽车维修的欺诈性保险索赔组成。该数据属于更宽泛的审计数据类别,后者还包括日记账与网络入侵数据。保险索赔数据与其他审计数据(如网络入侵数据)的显著不同在于其大量类别属性。我们着手解决异常检测中缺乏基准数据集的普遍问题:数据集大多保密,且公开表格数据集不含相关且充分的类别属性。因此,为此创建了一大型数据集,称为 Vehicle Claims (VC) 数据集。该数据集在浅层与深度学习方法上进行了评估。由于引入类别属性,我们遇到为大型数据集编码它们的挑战。由于高基数数据集的一热编码会引发“维数灾难”,我们实验了 GEL 编码与嵌入层来表示类别属性。我们的工作比较了竞争学习、重构误差、密度估计与对比学习方法在 Label、One Hot、GEL 编码和嵌入层下处理类别值的表现。

关键词

引用

@article{arxiv.2210.14056,
  title  = {Unsupervised Anomaly Detection for Auditing Data and Impact of Categorical Encodings},
  author = {Ajay Chawda and Stefanie Grimm and Marius Kloft},
  journal= {arXiv preprint arXiv:2210.14056},
  year   = {2022}
}

备注

This work has been accepted at Proceedings of the Neurips 2022 Workshop on Synthetic Data 4ML