中文

借助故障传播感知的微服务 RCA 评估方法论

软件工程 2025-12-24 v2

摘要

虽然云原生微服务架构已彻底革新了软件开发,但其固有的运营复杂性使得 failure Root Cause Analysis (RCA) 成为关键且具挑战性的任务。已提出诸多数据驱动的 RCA 模型以应对这一挑战。然而,我们发现用于评估这些模型的基准往往过于简单,无法反映真实场景。我们的初步研究表明,简单基于规则的方法在四个广泛使用的公共基准上的性能可与甚至超越最先进 (SOTA) 模型。这一发现表明,现有基准的过度简化可能导致对 RCA 方法性能的高估。为进一步调查该问题,我们系统性地分析了流行的公共 RCA 基准,识别出其在故障注入策略、调用图结构和遥测信号模式方面的关键局限。基于这些洞见,我们提出一个自动化框架,用于生成更具挑战性和全面的基准,包括复杂故障传播情景。我们的数据集包含 1,430 个经验证的故障案例,来自 9,152 次故障注入,覆盖 25 种故障类型(分为 6 类),包含动态工作负载和分层 ground-truth 标签,将故障从服务层面映射到代码层面的根因。关键的是,为了确保故障案例与 IT 操作相关,每种案例都经验证对用户可见 SLI 产生可辨识的影响。我们在新基准上对 11 个 SOTA 模型进行重新评估,发现其 Top@1 准确率很低,平均为 0.21,最佳模型仅达 0.37,且执行时间从数秒增加到数小时。

关键词

引用

@article{arxiv.2510.04711,
  title  = {Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark},
  author = {Aoyang Fang and Songhan Zhang and Yifan Yang and Haotong Wu and Junjielong Xu and Xuyang Wang and Rui Wang and Manyi Wang and Qisheng Lu and Pinjia He},
  journal= {arXiv preprint arXiv:2510.04711},
  year   = {2025}
}

备注

directly accepted by FSE'26, 87/920. project page: https://operationspai.github.io/revisiting-rca-evaluation/; dataset: https://doi.org/10.5281/zenodo.17105974