中文

稀疏奖励任务中零样子协调的多样化奖励塑形

机器学习 2026-04-29 v1

摘要

许多多智能体强化学习 (MARL) 智能体在与采用相同目标但不同随机种子、算法或其他训练差异的智能体合作时,无法正确适应。这就是零样子协调 (Zero-Shot Coordination, ZSC) 的问题,关注训练能够与未知智能体良好协作的智能体。ZSC 已在多种表格案例和简单游戏中进行研究,如 Hanabi,取得优异结果。然而,现有的 ZSC 方法仅考虑训练智能体的所有未来合作伙伴都具有相同的奖励。这在实际中并不现实,因为训练好的智能体并未考虑与拥有相同稀疏目标但以不同方式塑形奖励的智能体合作的问题。为此,我们展示了如何使用基于 4 种选择算法挑选的随机化奖励塑形训练一个方法集合。在 Overcooked 环境下的实验表明,与基线 ZSC 方法相比,针对拥有相同稀疏奖励但不同奖励塑形的智能体合作时,稀疏奖励提升了 62.2%-119.2%。

关键词

引用

@article{arxiv.2604.25076,
  title  = {Zero Shot Coordination for Sparse Reward Tasks with Diverse Reward Shapings},
  author = {Keenan Powell and Peihong Yu and Pratap Tokekar},
  journal= {arXiv preprint arXiv:2604.25076},
  year   = {2026}
}