中文

评估 LLM 在 Ad-Hoc Teamwork 中的情境强化学习极限

人工智能 2026-05-26 v1

摘要

情境强化学习(ICRL)已使基础代理能够即时适应新任务,但其在 Ad-Hoc Teamwork(AHT)——即需要与未知合作伙伴协调的场景——中的效果仍未探索。为严格评估这一问题,我们引入大规模基准 ICRL4AHT,基于高吞吐量 JAX 实现的 Overcooked-V2 构建。我们的基准包括广泛多样的队友套件,涵盖 RL 和启发式策略,支持受控的训练-测试偏移,并提供可复现的端到端管道,用于队友生成、学习历史收集、数据集构建和在线多回合评估。我们评估了代表性的历史条件 ICRL 算法,包括算法蒸馏(AD)和决策预训练变换器(DPT),跨数百万次转移。结果显示出显著局限:与单智能体领域中的成功相比,这些基线在多智能体环境中未能展现出鲁棒的测试时适应性。具体而言,这些方法在大量未见队友和未见布局轨迹中常常低于随机基线,长期视角下几乎没有明显的情境改进。这些发现凸显了在 OvercookedV2 AHT 协议下,由于部分可观测性导致的战略推断挑战,确立了为下一代协作算法搭建的关键测试平台。

关键词

引用

@article{arxiv.2605.24423,
  title  = {Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork},
  author = {Yuheng Jing and Kai Li and Ziwen Zhang and Jiajun Zhang and Zeyao Ma and Jiaxi Yang and Lei Zhang and Zhe Wu and Jinmin He and Junliang Xing and Jian Cheng},
  journal= {arXiv preprint arXiv:2605.24423},
  year   = {2026}
}

备注

41 pages, 14 figures