中文

CANTANTE:通过对比信用归因优化智能体系统

计算与语言 2026-05-14 v1 人工智能 多智能体系统

摘要

LLM 基于的多智能体系统在软件工程、预测建模和检索增强生成等复杂现实任务中展现出强大的性能,但自动化其配置仍是一个结构性挑战,因为仅能在系统层面获得评分,而支配智能体行为的参数则是局部的。我们认为,对这些系统进行优化本质上是一个信用分配问题。因此,我们引入 CANTANTE,一个通过对比同一查询下多个联合配置的 rollout 来将系统级奖励分解为各智能体更新信号的框架。我们为提示词优化实现了该框架,将智能体提示词视为可学习的系统参数。我们在编程(MBPP)、数学推理(GSM8K)和多跳问答(HotpotQA)上评估了 CANTANTE,与 GEPA 和 MIPROv2 进行比较。在这些基准测试中,CANTANTE 在所有评估优化器中获得最佳平均排名,并且始终优于未优化的提示词。它在 MBPP 上比最强基线提升 18.9 个百分点,在 GSM8K 上提升 12.5 个百分点,同时推理成本更低。在 HotpotQA 上,仍在最强基线的一个标准差内。关键的是,我们的信用相关性分析确认,归因器产生的是有意义的 per-agent 信号,而非仅反射全局系统评分。

关键词

引用

@article{arxiv.2605.13295,
  title  = {CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution},
  author = {Tom Zehle},
  journal= {arXiv preprint arXiv:2605.13295},
  year   = {2026}
}