面向业务影响的分布式即时支付系统故障检测特征工程方法
机器学习
2025-10-28 v1 人工智能
分布式、并行与集群计算
摘要
即时支付基础设施对性能有严格要求,日均处理数百万笔交易,期望零停机。传统监控方法难以在技术基础设施指标与业务流程可视化之间建立桥梁。我们引入一种基于连续 ISO 20022 消息交换处理时间计算的特征工程方法,创建系统状态的紧凑表示。通过对这些特征应用异常检测,实现早期故障检测与定位,支持事件分类。基于 TARGET Instant Payment Settlement (TIPS) 系统的实验评估,采用真实事件和受控仿真,展示了该方法在检测多样异常模式方面的有效性,提供可解释的解释,使运维人员能够理解业务影响。通过将特征映射到 distinct 处理阶段,该框架区分内部与外部支付系统问题,显著缩短调查时间,弥补分布式系统中事务状态跨多个实体碎片化的可观测性差距。
引用
@article{arxiv.2510.21710,
title = {A Feature Engineering Approach for Business Impact-Oriented Failure Detection in Distributed Instant Payment Systems},
author = {Lorenzo Porcelli},
journal= {arXiv preprint arXiv:2510.21710},
year = {2025}
}