中文

COSAC:顺序合作团队中的反事实信用分配

机器学习 2026-05-12 v2 人工智能 多智能体系统

摘要

在代理按固定顺序行动并共享单一团队级奖励的合作团队中(如多智能体语言系统、顺序机器人任务),代理级信用分配问题欠确定性。基于评论家的方法随着代理数量增长效果不佳,因需维护联合/因子化评论家;而现有无评论家方法又存在其他问题:代理间共享信用导致每个代理信号都与队友噪声耦合,重要性抽样校正用于上游更新滞后导致误差随团队规模指数级增长,或 per-agent 反事实回放需额外环境或奖励调用。我们提出 COSAC,一种无评论家的序列合作团队 per-agent 策略梯度。COSAC 通过对 rollout 批次进行单一岭回归来拟合团队奖励的可加 per-agent 分解(为每个代理提供独立于队友噪声的学习信号),并通过当前策略的虚构延续计算每个代理的反事实优势(取代重要性抽样重加权和 per-agent 环境回放,无需额外环境或奖励调用)。该估计器实现了 Sequential Aristocrat Utility (SeqAU),即我们对 Wolpert 和 Tumer (2001) 的 aristocrat utility 于序列团队的扩展。我们证明了 SeqAU 信用分配的偏差和方差界随团队规模保持可控。在序列多臂枪实验中,COSAC 在团队规模达到 K=16 时实现最低优势均方误差,并在各规模下保持一致低学习后悔。在 AI2 推理挑战 (ARC) 任务中,四个 Qwen3-0.6B 代理依次对 gradeschool science 问题进行推理,COSAC 优于其他无评论家基线实现更快收敛。

关键词

引用

@article{arxiv.2604.17693,
  title  = {COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams},
  author = {Shripad Deshmukh and Jayakumar Subramanian and Raghavendra Addanki and Nikos Vlassis},
  journal= {arXiv preprint arXiv:2604.17693},
  year   = {2026}
}