通过塑造组合 Q 学习规则中的学习信号以提高结构化合作
物理与社会
2026-02-03 v1
摘要
Q 学习提供了一种标准的强化学习框架,用于通过指定代理人从重复的局部互动结果中更新动作价值来研究合作。尽管之前的工作表明声誉可以促进此类系统中的合作,但大多数模型通过修改收益、在状态中直接编码声誉或改变合作伙伴选择来引入声誉,这使得很难隔离学习信号本身的作用。本文构建了学习信号作为声誉与游戏收益加权组合,保持游戏和网络结构不变。我们发现,增加声誉权重通常通过巩固聚类来促进合作,但这一作用是条件性的,取决于学习动力学。具体而言,在学习率极小的情况下(防止有效的信息传播)以及折扣因子趋近于 1 时(远期期望掩盖了即时声誉优势)时,这种促进作用会消失。在这些限制情况之外,声誉促进合作的效果会受到更高学习率的削弱,但会被更大的折扣因子放大。这些结果通过表明仅通过对学习信号进行声誉塑形即可稳定合作,提供了关于社交信息与 individual 学习参数相互作用的关键见解。
引用
@article{arxiv.2601.21392,
title = {Shaping the learning signal in a combined Q-learning rule to improve structured cooperation},
author = {Chunpeng Du and Zongyang Li and Yali Zhang and Yikang Lu and Attila Szolnoki},
journal= {arXiv preprint arXiv:2601.21392},
year = {2026}
}
备注
11 pages, 7 figures