中文

无监督伙伴设计实现稳健的临时协作

机器学习 2025-08-11 v1 人工智能 人机交互 多智能体系统

摘要

我们提出了无监督伙伴设计(UPD)——一种无需预训练伙伴或手动参数调谋即可实现稳健临时协作的多智能体强化学习框架。UPD通过对ego智能体策略进行随机混合并加入偏置随机行为,构建出多样化的伙伴;同时使用基于方差的可学习性度量对其进行评分,以优先选择接近ego智能体当前学习边缘的伙伴。我们展示了UPD可以与无监督环境设计集成,实现了在合作环境中对水平和伙伴分布的全无监督课程。通过在Overcooked-AI和Overcooked Generalisation Challenge上的广泛评估,我们证明了这种动态伙伴课程非常有效:UPD持续优于基于人口的和无人口的基线以及消除实验。我们进一步通过用户研究表明,UPD的所有基线都以更高的回报获胜,用户认为其更具适应性、更符合人类行为、是更好的合作者、更不令人沮丧。

关键词

引用

@article{arxiv.2508.06336,
  title  = {Unsupervised Partner Design Enables Robust Ad-hoc Teamwork},
  author = {Constantin Ruhdorfer and Matteo Bortoletto and Victor Oei and Anna Penzkofer and Andreas Bulling},
  journal= {arXiv preprint arXiv:2508.06336},
  year   = {2025}
}

备注

16 pages