中文

形式化契约缓解多智能体强化学习中的社会困境

人工智能 2024-01-30 v4 计算机科学与博弈论 多智能体系统 理论经济学

摘要

多智能体强化学习(MARL)是一种训练在共同环境中独立行动的自主智能体的有力工具。然而,当个体激励与群体激励背离时,它可能导致次优行为。人类在解决这些社会困境方面能力非凡。在MARL中复现此类合作行为于自私智能体上仍是一个开放问题。本工作中,我们借鉴经济学中的形式化缔约思想,以克服MARL中智能体间背离的激励。我们提出对马尔可夫博弈的一种增强,其中智能体在预定条件下自愿达成有约束力的奖励转移协议。我们的贡献兼具理论与经验。首先,我们表明在合同空间足够丰富时,该增强使所有完全可观测马尔可夫博弈的所有子博弈完美均衡均展现社会最优行为。其次,我们表明对于一般合同空间,即便在部分可观测下,更丰富的合同空间带来更高福利。因此,合同空间设计解决了探索-利用权衡,规避了激励问题。我们以实验补充理论分析。缔约增强中的探索问题通过使用受多目标强化学习启发的训练方法得以缓解:多目标契约增强学习(MOCA)。我们在静态单步博弈以及模拟交通、污染治理与公共资源管理的动态领域测试了我们的方法。

关键词

引用

@article{arxiv.2208.10469,
  title  = {Formal Contracts Mitigate Social Dilemmas in Multi-Agent RL},
  author = {Andreas A. Haupt and Phillip J. K. Christoffersen and Mehul Damani and Dylan Hadfield-Menell},
  journal= {arXiv preprint arXiv:2208.10469},
  year   = {2024}
}