利用 LSTM 设计与实现 Kubernetes 集群的自动化灾难恢复系统
分布式、并行与集群计算
2024-02-06 v1 机器学习
摘要
随着数据在现代商业环境中的重要性日益增加,有效的数据管理和保护策略正受到越来越多的研究关注。云环境中的数据保护对于保障信息资产和维持可持续服务至关重要。本研究介绍了一种集成 Kubernetes 管理平台与备份恢复工具的系统架构。该系统旨在即时检测灾难并自动从另一个 Kubernetes 集群恢复应用。实验结果表明,该系统无需人工干预即可在 15 秒内执行恢复过程,实现快速恢复。这反过来显著减少了与手动恢复过程相比潜在的延迟和错误,从而提高了云环境中的数据管理和恢复效率。此外,我们的研究模型利用长短期记忆(LSTM)网络预测集群的 CPU 利用率。通过与无调度实验的比较,更清晰地展示了通过此预测进行调度的必要性,证明了其防止性能退化的能力。本研究强调了云环境中自动恢复系统的效率和必要性,为未来研究指明了新方向。
引用
@article{arxiv.2402.02938,
title = {Design and Implementation of an Automated Disaster-recovery System for a Kubernetes Cluster Using LSTM},
author = {Ji-Beom Kim and Je-Bum Choi and Eun-Sung Jung},
journal= {arXiv preprint arXiv:2402.02938},
year = {2024}
}