面向分布式云的指标收集与聚合监控系统
分布式、并行与集群计算
2026-03-06 v1
摘要
要求实时处理大规模数据量的应用是重新构思传统云计算模型的主要驱动力,催生了新型云模型。分布式云 (Distributed Cloud, DC) 是一种模型,允许用户动态创建和释放 strategically located 的临时云,这些云包含最符合其需求的资源。对于该模型而言,提供高度可观测性是其在实际场景中可行的关键。本文提出了一种收集 DCs 指标并使其对 diverse clients 可用的监控系统的设计与实现。运行在节点上的代理负责收集机器级、容器级和应用级指标。在健康检查协议期间,这些数据从节点传输到运行在云内的 DC 的控制平面。随后,这些数据被持久化并通过多种 API 提供,其中包括流式 API。此外,还会聚合每个 DC 的节点指标,以提供更全面地查看系统状态。
引用
@article{arxiv.2603.05241,
title = {A monitoring system for collecting and aggregating metrics from distributed clouds},
author = {Tamara Ranković and Mateja Rilak and Janko Rakonjac and Miloš Simić},
journal= {arXiv preprint arXiv:2603.05241},
year = {2026}
}