中文

一种解决多智能体强化学习中责任扩散问题的策略共振方法

人工智能 2023-12-06 v3

摘要

SOTA 多智能体强化学习算法在许多方面不同于其单智能体对应算法。然而,它们大多仍完全继承了单智能体的探索—利用策略。 naive 地继承单智能体算法的该策略会导致潜在的协作失败,即智能体盲目跟随主流行为而拒绝承担少数派责任。我们称此问题为责任扩散(RD),因其与同名社会心理学效应相似。本工作中,我们首先从理论上分析该 RD 问题的成因,其可追溯到多智能体系统(尤其是大规模多智能体系统)的探索—利用困境。我们通过提出一种策略共振(PR)方法来解决该 RD 问题,该方法在保持个体策略近似不变的同时,通过重构联合智能体策略来修正智能体的协作探索策略。接着,我们展示 SOTA 算法可配备此方法以提升智能体在复杂协作任务中的协作性能。我们在多个测试基准任务上进行了实验以阐明该方法的有效性。

关键词

引用

@article{arxiv.2208.07753,
  title  = {A Policy Resonance Approach to Solve the Problem of Responsibility Diffusion in Multiagent Reinforcement Learning},
  author = {Qingxu Fu and Tenghai Qiu and Jianqiang Yi and Zhiqiang Pu and Xiaolin Ai and Wanmai Yuan},
  journal= {arXiv preprint arXiv:2208.07753},
  year   = {2023}
}