中文

混合数值与类别空间上异常检测的解释方法

机器学习 2022-09-12 v1 人工智能 人机交互 性能

摘要

异常检测领域的大多数研究仅关注检测阶段,尤其在近期的深度学习方法中。尽管这些模型预测精度很高,却常缺乏透明性,充当“黑盒”。这一批评已发展到解释性在可接受性与可靠性方面被视为极为重要的程度。本文通过审视ADMNC(混合数值与类别空间上的异常检测)模型来解决此问题,该已有模型虽准确但不可解释,能够处理数值与类别输入。本工作提出扩展模型EADMNC(混合数值与类别空间上可解释的异常检测),为原模型所得预测增添可解释性。借助Apache Spark框架,我们保留了原方法的可扩展性。EADMNC利用先前ADMNC模型的表述,提供事前与事后可解释性,同时保持原架构的精度。我们提出一个事前模型,通过将输入数据划分为仅由少数变量描述的同质组,从全局解释输出。我们设计了基于回归树的图形化表示,监管人员可据此检视以理解正常与异常数据的差异。我们的事后解释由基于文本的模板方法构成,从局部为每次检测提供文本论据。我们在大量真实数据(特别是网络入侵检测领域)上报告了实验结果。解释的有用性通过网络入侵领域专家知识的理论分析予以评估。

关键词

引用

@article{arxiv.2209.04173,
  title  = {Explanation Method for Anomaly Detection on Mixed Numerical and Categorical Spaces},
  author = {Iñigo López-Riobóo Botana and Carlos Eiras-Franco and Julio Hernandez-Castro and Amparo Alonso-Betanzos},
  journal= {arXiv preprint arXiv:2209.04173},
  year   = {2022}
}