迈向 AIOps 模型的一致性解释
机器学习
2022-02-07 v1 软件工程
摘要
人工智能运维(AIOps)已在各类组织的多种任务中得到采用,包括解释模型以识别服务故障的指标。为避免误导从业人员,AIOps 模型解释应当具有一致性(即同一任务上不同的 AIOps 模型在特征重要性上彼此一致)。然而,许多 AIOps 研究在推导解释时违背了机器学习界的既有规范,例如使用次优性能的模型进行解释,尽管此类违背对解释一致性的影响尚未被研究。本文中,我们沿三个维度——内部一致性、外部一致性与时间一致性——考察 AIOps 模型解释的一致性。我们在两个 AIOps 任务上开展案例研究:预测 Google 集群作业故障与 Backblaze 硬盘故障。我们发现,学习器的随机性、超参数调优与数据采样应当被控制以生成一致的解释。AUC 大于 0.75 的 AIOps 模型比较低性能模型产生更一致的解释。最后,采用滑动窗口或全历史方法构建的 AIOps 模型,其解释与整个数据集中呈现的趋势最为一致。我们的研究为从业人员推导一致的 AIOps 模型解释提供了有价值的指导。
引用
@article{arxiv.2202.02298,
title = {Towards a consistent interpretation of AIOps models},
author = {Yingzhe Lyu and Gopi Krishnan Rajbahadur and Dayi Lin and Boyuan Chen and Zhen Ming and Jiang},
journal= {arXiv preprint arXiv:2202.02298},
year = {2022}
}