强化学习的内在波动促进合作
机器学习
2023-02-22 v2 综合经济学
适应与自组织系统
物理与社会
经济学
摘要
在这项工作中,我们提出并回答了是什么使得采用 epsilon-greedy 策略的经典时序差分强化学习具有合作性。在社会困境情境中合作对动物、人类和机器都至关重要。尽管进化理论揭示了一系列促进合作的机制,但智能体学习合作的条件仍存在争议。在此,我们展示了多智能体学习设定中的哪些个体要素以及如何导致合作。我们以具有单周期记忆的重复囚徒困境作为测试平台。两个学习智能体各自学习一种策略,该策略基于双方上一轮的动作选择来决定随后的动作选择。我们发现,除了高度关注未来奖励、低探索率和小学习率之外,主要是强化学习过程的内在随机波动将最终合作率提升至最高 80%。因此,固有噪声并非迭代学习过程不得已的弊端,而是学习合作的关键要素。然而,我们也指出了合作行为的高可能性与在合理时间内达成合作之间的权衡。我们的发现对于有意设计合作算法和规制不良的串谋效应具有参考意义。
引用
@article{arxiv.2209.01013,
title = {Intrinsic fluctuations of reinforcement learning promote cooperation},
author = {Wolfram Barfuss and Janusz Meylahn},
journal= {arXiv preprint arXiv:2209.01013},
year = {2023}
}
备注
21 pages, 7 figures