中文

谁获得奖励,谁承担责任?面向多 LLM 代理的评估对齐训练信号

多智能体系统 2025-11-19 v2 人工智能 计算与语言 计算机科学与博弈论

摘要

大语言模型(LLM)在多代理系统(MAS)中展现出广泛前景,但现有训练方法缺乏将系统级评估与代理级及消息级学习相结合的原则方法。我们提出了一种理论框架,将合作博弈论归因与过程奖励建模统一,以将系统评估转化为代理信用,再转化为响应层面的信号。与依赖仅归因(如Shapley)或步骤级标签(如PRM)的先前方法不同,我们的方法产生局部、有符号且信用守恒的信号。在成功案例中,基于Shapley的信用分配公正地在代理之间分配结果,并细化为每条消息的奖励,以促进合作,同时抑制冗余或破坏。在失败案例中,首次错误定位产生修复感知的偏好,惩罚有害步骤,同时奖励纠正尝试。所得信号受限、合作且直接兼容基于强化的或基于偏好的后训练,为从全局评估到局部监督的统一且可审计的路径。我们的贡献是概念性的:我们提出理论基础和训练信号,留下实证验证给未来工作。

关键词

引用

@article{arxiv.2511.10687,
  title  = {Who Gets the Reward, Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents},
  author = {Chih-Hsuan Yang and Tanwi Mallick and Le Chen and Krishnan Raghavan and Azton Wells and Amal Gueroudji and Ian T. Foster and Rajeev Thakur},
  journal= {arXiv preprint arXiv:2511.10687},
  year   = {2025}
}

备注

Withdrawing temporarily to coordinate revisions with co-authors. A revised version will be resubmitted