图约束下的动态社会学习
最优化与控制
2021-07-27 v3 机器学习
概率论
摘要
我们引入一种由正 -齐次奖励建模强化的图约束动态选择模型。我们证明其经验过程(可写为带马尔可夫噪声的随机逼近递推)与某类顶点增强随机游走具有相同的概率律。我们利用这一等价性表明,对于 ,当通过令 缓慢进行“退火”时,渐近结果在某种极限意义下围绕最优值集中。
引用
@article{arxiv.2007.03983,
title = {Dynamic social learning under graph constraints},
author = {Konstantin Avrachenkov and Vivek S. Borkar and Sharayu Moharir and Suhail M. Shah},
journal= {arXiv preprint arXiv:2007.03983},
year = {2021}
}