中文

CooT:通过协调转换器学习内在上下文中的协调

人工智能 2026-05-19 v3 人机交互 机器学习

摘要

在多智能体系统中,面对陌生伙伴的有效协调仍是主要挑战。现有方法如基于群体的方法通过多样性提高鲁棒性,但常缺乏针对训练分布之外的高效适应机制。此外,few-shot 设置下微调因其高互动成本往往不可行。为此,我们提出CooT框架,利用内在上下文学习(ICL)实现实时伙伴适应。不同于侧重任务泛化的先前ICL方法,CooT设计用于跨 diverse 伙伴行为进行泛化。在基于偏好行为代理的轨迹上训练后,它通过纯观察学习与伙伴意图对齐。我们在两个具有挑战性的多智能体基准测试上评估CooT:Overcooked 和 Google Research Football。结果表明,CooT consistently 超越群体方法、梯度微调和Meta-RL基线,实现无需参数更新的稳定快速适应。人类评估还将CooT识别为首选合作者。我们的消融实验确认,其快速适应新伙伴且在伴随突发性伙伴变化时仍保持稳定,使其在实际人机协作中可靠。

关键词

引用

@article{arxiv.2506.23549,
  title  = {CooT: Learning to Coordinate In-Context with Coordination Transformers},
  author = {Huai-Chih Wang and Hsiang-Chun Chuang and Hsi-Chun Cheng and Dai-Jie Wu and Shao-Hua Sun},
  journal= {arXiv preprint arXiv:2506.23549},
  year   = {2026}
}

备注

ICML 2026