中文

学习长期出价:重复拍卖博弈中具有长期稀疏奖励的多智能体强化学习

机器学习 2022-04-06 v1 计算机科学与博弈论

摘要

我们提出了一种多智能体分布式强化学习算法,该算法在潜在冲突的短期奖励与稀疏、延迟的长期奖励之间进行平衡,并在动态环境中利用部分信息进行学习。我们比较了不同的长期奖励,以激励算法最大化个体收益与整体社会福利。我们在两个模拟拍卖博弈中测试了该算法,并证明:1) 在直接竞争中,我们的算法以牺牲社会福利为代价优于两种基准算法;2) 我们算法的激进竞争行为可通过长期奖励信号加以引导,从而同时最大化个体收益与整体社会福利。

关键词

引用

@article{arxiv.2204.02268,
  title  = {Learning to Bid Long-Term: Multi-Agent Reinforcement Learning with Long-Term and Sparse Reward in Repeated Auction Games},
  author = {Jing Tan and Ramin Khalili and Holger Karl},
  journal= {arXiv preprint arXiv:2204.02268},
  year   = {2022}
}