合作多智能体奖励无探索中的时限阈值
机器学习
2026-05-14 v3
摘要
我们研究了在奖励无探索设定下的合作多智能体强化学习,多个智能体共同探索未知 MDP 以学习其动态(不观测奖励)。我们聚焦于表格型有限时长 MDP,采用分阶段学习框架。在每个学习阶段,多个智能体独立与环境交互。具体而言,在每个学习阶段中,每个智能体被分配一个策略,执行该策略并观察所得轨迹。我们的主要目标是刻画学习阶段数量与智能体数量之间的权衡,尤其当学习阶段数量较小时。我们的结果识别了一个由时限 决定的 regime 转换。当学习阶段数等于 时,我们提出了一个计算高效的算法,只需 个智能体即可获得该动态的 近似值(即为任意奖励函数获得 最优策略)。我们用下界补充了该算法,表明任何限制在 个阶段的数算法,至少需要 个智能体才能实现常数精度。因此,我们表明当限制智能体数为多项式时,拥有 个学习阶段是必要且充分的。
引用
@article{arxiv.2602.01453,
title = {The Horizon Threshold in Cooperative Multi-Agent Reward-Free Exploration},
author = {Idan Barnea and Orin Levy and Yishay Mansour},
journal= {arXiv preprint arXiv:2602.01453},
year = {2026}
}