中文

关于 AIOps 解决方案中监督学习的模型更新策略

软件工程 2024-04-15 v2

摘要

AIOps(智能运维)解决方案利用大规模系统运行期间产生的海量数据和机器学习模型,协助软件工程师进行系统运维。由于运行环境和使用群体变化等因素,现场产生的运维数据不断演化,因此 AIOps 解决方案中的模型在部署后需要持续维护。已有工作主要关注创新的建模技术以提升 AIOps 模型发布前的性能,而何时以及如何更新 AIOps 模型仍是一个研究不足的课题。在本工作中,我们对三个大规模公共运维数据进行了案例研究,并从性能、更新成本和稳定性方面实证评估了五类不同的监督学习模型更新策略。我们观察到主动模型更新策略(例如周期性重训练、概念漂移引导重训练、基于时间的模型集成和在线学习)比静态模型取得更好且更稳定的性能。特别是,应用精细的模型更新策略比简单地周期性重训练 AIOps 模型能提供更好的性能、效率和稳定性。此外,我们观察到,尽管某些更新策略可节省模型训练时间,却显著牺牲了模型测试时间,这可能阻碍其在运维数据高速大量到达且需要即时推断的 AIOps 解决方案中的应用。我们的发现强调从业者应考虑运维数据的演化并主动持续维护 AIOps 模型。我们的观察也可指导研究者和从业者探索更适合 AIOps 背景、更高效有效的模型更新策略。

关键词

引用

@article{arxiv.2311.03213,
  title  = {On the Model Update Strategies for Supervised Learning in AIOps Solutions},
  author = {Yingzhe Lyu and Heng Li and Zhen Ming and Jiang and Ahmed E. Hassan},
  journal= {arXiv preprint arXiv:2311.03213},
  year   = {2024}
}