具有丢包_bandit反馈的重复非合作博弈中的无悔学习
机器学习
2022-05-17 v1 最优化与控制
摘要
本文研究具有丢包bandit反馈的重复连续核博弈中的无悔学习。由于在动态环境中难以给出效用函数的显式模型,智能体的动作只能借助bandit反馈来学习。此外,由于不可靠的通信信道或隐私保护,bandit反馈可能随机丢失或丢弃。因此,我们研究智能体的异步在线学习策略,以自适应调整下一步动作,最小化长期后悔损失。本文提出一种新颖的无悔学习算法,称为带丢包bandit的在线梯度下降(OGD-lb)。我们首先给出具有可微且Lipschitz效用函数的凹博弈的后悔分析。然后我们证明,当博弈同时严格单调时,动作分布以概率1收敛到纳什均衡。我们进一步给出当博弈为β-强单调时的均方收敛速率。此外,我们将算法扩展到bandit反馈丢失概率未知的情形,并证明其在严格单调博弈中几乎必然收敛到纳什均衡。最后,我们以雾计算中的资源管理为应用示例,进行数值实验以实证展示算法性能。
引用
@article{arxiv.2205.06968,
title = {No-regret learning for repeated non-cooperative games with lossy bandits},
author = {Wenting Liu and Jinlong Lei and Peng Yi and Yiguang Hong},
journal= {arXiv preprint arXiv:2205.06968},
year = {2022}
}
备注
14 pages,11 figures