超越任务成功率:衡量基于 LLM 的智能体支付系统中的工作流保真度
人工智能
2026-05-08 v1
摘要
基于 LLM 的多智能体系统正越来越多地部署于支付工作流中,然而现有的主流指标——任务成功率(TSR)和智能体交接 F1 分数(HF1)——仅捕获最终结果或无序的路由决策。我们引入了智能体成功率(ASR),这是一种轨迹保真度指标,在转移层比较观测到的和预期的智能体执行序列,将性能分解为转移召回率和转移精确率。将 ASR 应用于支付分层多智能体系统(HMASP),涵盖 18 个 LLM 和 90,000 个任务实例,ASR 显示 18 个模型中有 10 个在支付结账期间系统性地跳过了确认检查点,这一偏差对 TSR 和 HF1 均不可见,而 8 个模型完美执行了该检查点。值得注意的是,GPT-4.1 尽管实现了完美的 TSR 和 HF1,却表现出隐藏的工作流捷径,而 GPT-5.2 实现了完美的 ASR。由 ASR 诊断指导的提示词优化和确定性路由防护产生了显著的 TSR 改进,对于先前表现不佳的模型提升高达 +93.8 个百分点,这表明在受监管领域中,轨迹级评估是必不可少的。
引用
@article{arxiv.2605.06457,
title = {Beyond Task Success: Measuring Workflow Fidelity in LLM-Based Agentic Payment Systems},
author = {Donghao Huang and Joon Kiat Chua and Zhaoxia Wang},
journal= {arXiv preprint arXiv:2605.06457},
year = {2026}
}
备注
6 pages, 2 tables. Accept at AI and Data Science for Digital Finance (AIDS4DF) Workshop, PAKDD 2026