中文

LOPT:在序贯社会困境中学习最优庇古税

多智能体系统 2026-03-18 v2

摘要

在多智能体强化学习(MARL)中,每个智能体行动以最大化其个体累积奖励。然而,个体累积奖励无法完全反映其他智能体对它们的看法,导致自私行为损害全局性能。外部性理论,定义为“一个经济主体的活动以未反映于市场交易中的方式影响另一主体的活动”,适用于分析MARL中的社会困境。其最深远的非市场解决方案之一“庇古税(Pigovian Tax)”,通过对制造负外部性者征税、对制造正外部性者补贴来内化外部性,可助力开发解决MARL社会困境的机制。本文旨在应用外部性理论分析MARL中的社会困境。为内化MARL中的外部性,提出学习最优庇古税方法(LOPT),其中引入一个额外智能体来学习税收/补贴分配策略,以逼近准确反映所有智能体外部性的最优“庇古税”。此外,基于逼近最优“庇古税”的奖励塑形机制被应用于降低各智能体的社会成本,并尝试缓解社会困境。与现有SOTA方法相比,所提LOPT在Escape Room与Cleanup环境中均带来更高的集体社会福利,显示了我们的方法在解决社会困境上的优越性。

关键词

引用

@article{arxiv.2305.06227,
  title  = {LOPT: Learning Optimal Pigovian Tax in Sequential Social Dilemmas},
  author = {Yun Hua and Shang Gao and Wenhao Li and Haosheng Chen and Bo Jin and Xiangfeng Wang and Jun Luo and Hongyuan Zha},
  journal= {arXiv preprint arXiv:2305.06227},
  year   = {2026}
}

备注

20 pages,13 figures