基于异常检测与特征评分的可读网络故障排查
网络与互联网体系结构
2021-08-27 v1 人工智能
机器学习
摘要
网络故障排查仍是一个高度依赖人力的过程。为减少人工运维人员在诊断过程中耗费的时间,我们提出了一种系统,其基于(i)用于检测时域异常的无监督学习方法,(ii)在特征空间中对特征进行排序的注意力机制,以及(iii)能够无缝整合既往领域知识的专家知识模块。本文中,我们对该完整系统及其各组成模块的性能进行了深入评估:特别地,我们考虑了(i)10 种异常检测算法以及(ii)10 种注意力机制,它们全面代表了各自领域当前的最优水平。利用一份独特的专家标注数据集(包含数月真实路由器遥测数据),我们开展了详尽的性能评估,将受限流模式下的实际结果与学术设定中理想 oracle 可达的结果进行对比。实验评估表明:(i)所提系统能有效地与专家判断达成高度一致;(ii)即便是简单的统计方法也能从过往案例中获取的专家知识提取有用信息,显著改善故障排查性能。
引用
@article{arxiv.2108.11807,
title = {Human readable network troubleshooting based on anomaly detection and feature scoring},
author = {Jose M. Navarro and Alexis Huet and Dario Rossi},
journal= {arXiv preprint arXiv:2108.11807},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2107.11078