面向多智能体LLM的过滤反馈下反事实策略梯度:CoFi-PGMA模型
机器学习
2026-04-28 v1
摘要
大型语言模型(LLM)的部署日益依赖多智能体架构, 其中多个模型通过路由机制竞争或协作以产生最终答案。在此设置中, 每个智能体接收的学习信号被系统机制过滤。路由产生选择门控反馈, 即仅对所选响应进行评估; 而协作产生共享奖励, 掩盖每个智能体的贡献。结果是, 针对单一部署策略设计的标准RLHF目标在多智能体LLM系统中变得不准确。我们提出CoFi-PGMA(Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs),一个统一框架, 用于在多智能体LLM系统中学习过滤反馈。我们的ethods派生出一种基于边际贡献的反事实智能体训练目标, 纠正路由和协作机制下的学习信号。对于路由系统, 该目标对应于选择门控反馈的离策略校正; 对于协作系统, 它简化为leave-one-out差异奖励以实现信用分配。我们进一步分析Softmax路由如何诱导风险敏感激励, 并提供实用的训练算法, 集成反事实估计器、多轮aware奖励和策略优化方法, 并在真实世界的推理数据集上进行演示。
引用
@article{arxiv.2604.22785,
title = {CoFi-PGMA: Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs},
author = {Stela Tong and Elai Ben-Gal},
journal= {arXiv preprint arXiv:2604.22785},
year = {2026}
}
备注
17 pages, 0 figures