中文

IQ-Flow:在序贯社会困境中诱导自利智能体合作行为的机制设计

多智能体系统 2023-03-07 v2 人工智能 计算机科学与博弈论 机器学习

摘要

实现并维持智能体间为达成共同目标的合作是多智能体强化学习(MARL)的核心目标之一。然而,在许多真实场景中,分别训练且专业化的智能体被部署到共享环境中,或环境要求由不同共存方实现多个目标。这些专业与目标上的差异可能引发混合动机,最终导致所有方均受损的社会困境。为解决此问题,我们提出激励 Q-流(IQ-Flow)算法,其通过激励调节智能体修改系统的奖励设置,使得合作策略同时也对应于智能体的自利策略。与现有学习激励自利智能体的方法不同,IQ-Flow 不对智能体的策略或学习算法做任何假设,从而使所开发框架可泛化至更广泛的应用。IQ-Flow 利用其他智能体提供的数据对所学策略的最优性进行离线评估,以确定合作与自利策略。接着,IQ-Flow 使用元梯度学习来估计策略评估如何随给定激励变化,并修改激励使得合作目标与自利目标的贪婪策略产生相同动作。我们在迭代矩阵博弈中展示了 IQ-Flow 的运算特性。我们证明 IQ-Flow 在 Escape Room 与 2-Player Cleanup 环境中优于最先进的激励设计算法。我们进一步证明,预训练的 IQ-Flow 机制在 2-Player Cleanup 环境中显著优于共享奖励设置的表现。

关键词

引用

@article{arxiv.2302.14604,
  title  = {IQ-Flow: Mechanism Design for Inducing Cooperative Behavior to Self-Interested Agents in Sequential Social Dilemmas},
  author = {Bengisu Guresti and Abdullah Vanlioglu and Nazim Kemal Ure},
  journal= {arXiv preprint arXiv:2302.14604},
  year   = {2023}
}

备注

AAMAS 2023