中文

工业界如何应对运行时异常:方法与关键监控参数

软件工程 2024-08-16 v1

摘要

由于系统复杂性的增加,尤其是微服务系统,运行时偏离预期行为的现象(即异常)变得越来越常见。因此,分析运行时监控数据(如微服务的日志、追踪和指标)因数据量庞大而具有挑战性。开发有效的规则或AI算法需要深入理解这些数据,以可靠地检测未预见的异常。本文旨在理解跨不同工业领域的异常及其当前的异常检测方法。此外,本文旨在确定通过运行时监控数据识别异常所需的参数。因此,我们对十五位依赖运行时异常检测的行业参与者进行了半结构化访谈。此外,为了补充访谈信息,我们进行了文献综述,重点关注应用于工业真实数据集的异常检测方法。本文(1)展示了运行时软件异常的多样解释和实例;(2)探讨了工业界选择基于规则的方法而非自研AI方法的原因。基于AI的方法在过去三年发表的工业相关论文中已变得突出。此外,我们(3)确定了在运行时收集的关键监控参数(日志、追踪和指标),这些参数帮助从业者在运行时检测异常,同时避免因参数不明确而引入检测偏差。

关键词

引用

@article{arxiv.2408.07816,
  title  = {How Industry Tackles Anomalies during Runtime: Approaches and Key Monitoring Parameters},
  author = {Monika Steidl and Benedikt Dornauer and Michael Felderer and Rudolf Ramler and Mircea-Cristian Racasan and Marko Gattringer},
  journal= {arXiv preprint arXiv:2408.07816},
  year   = {2024}
}

备注

accepted at 2024 50th Euromicro Conference on Software Engineering and Advanced Applications (SEAA)