中文

B3C:一种针对离线多智能体强化学习的极简方法

机器学习 2026-02-16 v3

摘要

来自在策略评估期间选择未见动作导致的估计偏差,是离线强化学习(RL)中的一个主要挑战。单智能体环境中一种极简方法——将行为克隆(BC)正则化添加到现有在线RL算法中——被证明有效;然而,该方法在多智能体环境中研究不足。特别是,由于存在多个动作,估计偏差在多智能体环境中会变得更糟,导致基于BC正则化的方法容易出现过正则化或批评家发散。为此,我们提出一种简单而有效的方法:行为克隆正则化伴随批评家裁剪(B3C),该方法根据数据集中最大回报对策略评估中的目标批评家值进行裁剪,从而提高了性能。此外,我们利用现有的价值分解技术,特别是较少在离线环境中研究的非线性分解。结合非线性价值分解后,B3C在各种离线多智能体基准测试中超越了最先进的算法。

关键词

引用

@article{arxiv.2501.18138,
  title  = {B3C: A Minimalist Approach to Offline Multi-Agent Reinforcement Learning},
  author = {Woojun Kim and Katia Sycara},
  journal= {arXiv preprint arXiv:2501.18138},
  year   = {2026}
}

备注

Accepted at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)