云计算环境中在线自演化的异常检测
分布式、并行与集群计算
2021-11-17 v1 人工智能
摘要
现代云计算系统包含数百至数千台计算和存储服务器。这样的规模,加上不断增长的系统复杂性,给可靠云计算的故障与资源管理带来了关键挑战。自主故障检测是理解突发性全局云现象并自我管理云资源以保障系统级可靠性的关键技术。为检测故障,我们需要监控云执行并收集运行时性能数据。这些数据通常是未标记的,因此在生产云中并非总能得到先前的故障历史。在本文中,我们提出一种用于云可靠性保障的\emph{自演化异常检测}(SEAD)框架。我们的框架通过递归探索新验证的异常记录并持续在线更新异常检测器来实现自演化。作为我们框架的一个显著优势,云系统管理员只需检查少量被检测出的异常,而其决策被用于更新检测器。因此,检测器随着系统硬件升级、软件栈更新以及用户工作负载变化而演化。此外,我们设计了两类检测器,一类用于通用异常检测,另一类用于特定类型异常检测。在自演化技术的帮助下,我们的检测器在灵敏度上平均达到88.94%,在特异度上平均达到94.60%,使其适合实际部署。
引用
@article{arxiv.2111.08232,
title = {Online Self-Evolving Anomaly Detection in Cloud Computing Environments},
author = {Haili Wang and Jingda Guo and Xu Ma and Song Fu and Qing Yang and Yunzhong Xu},
journal= {arXiv preprint arXiv:2111.08232},
year = {2021}
}