从虚拟博弈型算法中的弱学习到强学习
最优化与控制
2015-04-21 v1 计算机科学与博弈论
概率论
摘要
本文研究了极具代表性的虚拟博弈 (FP) 算法,以及一类基于最优反应动力学的学习过程(我们称之为 FP 型算法)。FP 的一个众所周知的缺点是,虽然参与者可能在某种抽象意义上学习到均衡策略,但该算法生成的逐期策略本身并不能保证收敛到均衡。这一问题本质上与最优反应对应关系的不连续性有关,并被许多 FP 型算法所继承。这不仅导致在将此类算法解释为经济和社会学习机制时产生问题,也极大地削弱了这些算法在分布式控制中的实用价值。我们将参与者仅在某种抽象意义上学习均衡的形式(将在文中更精确定义)称为弱学习,而将参与者的逐期策略收敛到均衡的学习形式称为强学习。本文提出了一种修改 FP 型算法的方法,将实现弱学习的算法构造成实现强学习的变体,并证明了理论收敛结果。
引用
@article{arxiv.1504.04920,
title = {From Weak Learning to Strong Learning in Fictitious Play Type Algorithms},
author = {Brian Swenson and Soummya Kar and Joao Xavier},
journal= {arXiv preprint arXiv:1504.04920},
year = {2015}
}
备注
22 pages