中文

通过学习的潜在策略适应性地与陌生伙伴协调

人工智能 2025-11-18 v1 机器学习 多智能体系统

摘要

适应性是有效协作中异构成员之间沟通的基石。在人类-智能体团队中,人工智能体需要实时适应其人类伙伴,因为个体常有独特的偏好和策略,且可能在相互作用期间动态变化。在存在时间压力和复杂战略空间的任务中,识别伙伴行为并选择合适的响应变得尤为困难。本文引入一种策略条件化合作者框架,学习如何在实时内代表、分类和适应广泛的潜在伙伴策略。我们的方法使用变分自编码器对策略进行编码,从智能体轨迹数据中学习潜在策略空间,通过聚类识别不同的策略类型,并通过生成每种策略类型的伙伴来训练条件于这些聚类的合作者代理。对于与陌生伙伴的在线适应,我们利用固定份额 regret 最小化算法动态推断和调整伙伴策略估计。我们在修改版的 Overcooked 域上进行评估,该域是一个需要两个玩家之间有效协调的复杂合作烹饪环境,涵盖多样化的潜在策略空间。通过这些实验和在线用户研究,我们表明,所提出的代理在与陌生人类和智能体同伴搭配时实现了与现有基线方法相比的最先进性能。

关键词

引用

@article{arxiv.2511.12754,
  title  = {Adaptively Coordinating with Novel Partners via Learned Latent Strategies},
  author = {Benjamin Li and Shuyang Shi and Lucia Romero and Huao Li and Yaqi Xie and Woojun Kim and Stefanos Nikolaidis and Michael Lewis and Katia Sycara and Simon Stepputtis},
  journal= {arXiv preprint arXiv:2511.12754},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025