中文

基于上下文感知探索的快速同伴适应

人工智能 2024-08-12 v2 机器学习 多智能体系统

摘要

在多智能体博弈中,快速适应具有不同策略的未知同伴(伙伴或对手)是一项关键挑战。为此,智能体高效地探测和识别同伴策略至关重要,因为这是在适应中执行最佳响应的前提。然而,探索未知同伴的策略是困难的,尤其是在博弈具有部分可观测性且长视野的情况下。在本文中,我们提出了一种同伴识别奖励,该奖励根据学习智能体在历史上下文(如多个回合的观测)上识别同伴行为模式的好坏程度来给予奖励。这种奖励促使智能体学习一种上下文感知策略,以实现有效探索和快速适应,即在不确定同伴策略时主动寻求并收集信息丰富的反馈,并在有把握时利用上下文执行最佳响应。我们在涉及竞争性(Kuhn Poker)、合作性(PO-Overcooked)或混合性(Predator-Prey-W)博弈与同伴智能体的多样化测试平台上评估了我们的方法。我们证明,我们的方法引发了更主动的探索行为,与现有方法相比实现了更快的适应和更好的结果。

关键词

引用

@article{arxiv.2402.02468,
  title  = {Fast Peer Adaptation with Context-aware Exploration},
  author = {Long Ma and Yuanfei Wang and Fangwei Zhong and Song-Chun Zhu and Yizhou Wang},
  journal= {arXiv preprint arXiv:2402.02468},
  year   = {2024}
}

备注

ICML 2024. 20 pages