通过异构数据中的对比检测异常
机器学习
2021-04-05 v1
摘要
检测异常一直是发现潜在欺诈活动的基本方法。面对检测威胁生态系统与经济并与其他非法活动关联的非法木材贸易的任务,我们将问题表述为异常检测。除其他挑战外,我们的大规模具有异构特征(类别型与连续型)的贸易数据缺乏标注,而这些标注可辅助构建检测欺诈交易的自动化系统。我们将任务建模为无监督异常检测,提出一种新颖的基于对比学习的异构异常检测器以解决先前模型的不足。我们的模型使用非对称自编码器,可有效处理大基数类别变量,但避免对低维潜空间数据结构作假设,并对超参数变化具有鲁棒性。数据似然由估计器网络通过负采样近似,该网络与自编码器联合训练。进一步概述了针对异构数据的有效负样本生成方法的细节与直观解释。我们提供了定性研究以展示模型在木材贸易异常检测中的有效性。
引用
@article{arxiv.2104.01156,
title = {Detecting Anomalies Through Contrast in Heterogeneous Data},
author = {Debanjan Datta and Sathappan Muthiah and Naren Ramakrishnan},
journal= {arXiv preprint arXiv:2104.01156},
year = {2021}
}