基于反事实推理的智能体影响力排名器用于智能体AI工作流程
人工智能
2025-10-30 v1 多智能体系统
摘要
智能体AI工作流程 (AAW),也称为基于LLM的多智能体系统,是一种自动将多个LLM-based智能体组装起来共同完成目标的自主系统。该工作流程的高度自主性、广泛采用以及日益增长的关注度凸显了从质量和安全方面深入理解其运作的需求。迄今为止,尚无方法可评估每个智能体对AAW最终输出的影响力。采用现有方法不可行,因为这些方法仅进行静态结构分析,难以适用于推理时间执行。在本工作中,我们提出了反事实推理智能体影响力排名器 (CAIR)——这是一种用于评估每个智能体对AAW输出影响程度并确定哪些智能体最具影响力的方法。通过进行反事实分析,CAIR提供一种任务无关的分析,可用于离线使用或推理时使用。我们使用我们创建的AAW数据集进行评估,该数据集包含30种不同用例和230种不同功能。我们的评估显示,CAIR产生一致的排名,优于基线方法,并且可以轻松地增强下游任务的有效性和相关性。
引用
@article{arxiv.2510.25612,
title = {Counterfactual-based Agent Influence Ranker for Agentic AI Workflows},
author = {Amit Giloni and Chiara Picardi and Roy Betser and Shamik Bose and Aishvariya Priya Rathina Sabapathy and Roman Vainshtein},
journal= {arXiv preprint arXiv:2510.25612},
year = {2025}
}
备注
Accepted to EMNLP 2025, 27 pages, 6 figures