中文

合作多智能体奖励无探索中的时限阈值

机器学习 2026-05-14 v3

摘要

我们研究了在奖励无探索设定下的合作多智能体强化学习,多个智能体共同探索未知 MDP 以学习其动态(不观测奖励)。我们聚焦于表格型有限时长 MDP,采用分阶段学习框架。在每个学习阶段,多个智能体独立与环境交互。具体而言,在每个学习阶段中,每个智能体被分配一个策略,执行该策略并观察所得轨迹。我们的主要目标是刻画学习阶段数量与智能体数量之间的权衡,尤其当学习阶段数量较小时。我们的结果识别了一个由时限 HH 决定的 regime 转换。当学习阶段数等于 HH 时,我们提出了一个计算高效的算法,只需 O~(S6H6A/ϵ2)\tilde{O}(S^6 H^6 A / \epsilon^2) 个智能体即可获得该动态的 ϵ\epsilon 近似值(即为任意奖励函数获得 ϵ\epsilon 最优策略)。我们用下界补充了该算法,表明任何限制在 ρ<H\rho < H 个阶段的数算法,至少需要 AH/ρA^{H/\rho} 个智能体才能实现常数精度。因此,我们表明当限制智能体数为多项式时,拥有 Θ(H)\Theta(H) 个学习阶段是必要且充分的。

关键词

引用

@article{arxiv.2602.01453,
  title  = {The Horizon Threshold in Cooperative Multi-Agent Reward-Free Exploration},
  author = {Idan Barnea and Orin Levy and Yishay Mansour},
  journal= {arXiv preprint arXiv:2602.01453},
  year   = {2026}
}