中文

云服务异常检测建模:影响延迟和资源消耗的特性分析

分布式、并行与集群计算 2025-11-24 v1

摘要

检测和解决云服务中的性能异常对于维持所需的性能目标至关重要。由异常检测器触发的扩缩操作有助于实现目标延迟,但会增加额外的资源消耗。然而,性能异常检测器会出错。本文研究哪些性能异常检测特性对优化性能与成本之间的权衡最为重要。使用随机奖励网,我们对由性能异常检测器监控的云服务进行建模。通过我们的模型,我们研究了检测特性(即精度、召回率和检查频率)对受监控服务平均延迟和资源消耗的影响。我们的结果表明,实现高精度和高召回率并总是必要的。如果可以频繁运行检测,则只需高精度即可获得良好的性能-成本权衡,但如果检测器运行频率较低,则召回率变得最重要。

关键词

引用

@article{arxiv.2511.17119,
  title  = {Modeling Anomaly Detection in Cloud Services: Analysis of the Properties that Impact Latency and Resource Consumption},
  author = {Gabriel Job Antunes Grabher and Fumio Machida and Thomas Ropars},
  journal= {arXiv preprint arXiv:2511.17119},
  year   = {2025}
}