独自应对:基于对比强化学习优化的个性化竞争行为学习
人工智能
2023-10-03 v1 机器学习
摘要
在竞争博弈场景中,一组智能体须学习决策,以同时最大化自身目标并最小化对手目标。除应对由对手行动导致的场景动态性增强外,它们通常还需理解如何克服对手策略。然而,大多数常见方案(通常基于持续学习或集中式多智能体经验)不允许发展出面对个体对手的个性化策略。本文提出一种由三层神经网络构成的新型模型,其学习竞争博弈的表示、学习映射特定对手的策略,并学习如何扰乱对手。整个模型以在线方式训练,采用基于对比优化的复合损失来学习竞争与多人博弈。我们在宝可梦对战场景与四人对战Chef's Hat纸牌博弈上评估模型。实验表明,相较于离线、在线及竞争专用模型,我们的模型表现更优,尤其在与同一对手多次对战时。我们还讨论了模型的影响,特别是其在两种场景下对特定策略学习的处理能力。
引用
@article{arxiv.2310.00964,
title = {All by Myself: Learning Individualized Competitive Behaviour with a Contrastive Reinforcement Learning optimization},
author = {Pablo Barros and Alessandra Sciutti},
journal= {arXiv preprint arXiv:2310.00964},
year = {2023}
}