带噪声反馈博弈中的无遗憾学习:通过学习率分离实现更快收敛与自适应性
计算机科学与博弈论
2023-03-20 v2 机器学习
摘要
我们研究当学习者在与其他优化智能体参与的连续博弈中时的遗憾最小化问题:在此情形下,若所有玩家遵循无遗憾算法,则相对完全对抗环境有可能实现显著更低的遗憾。我们在变分稳定博弈(一类包含所有凸-凹与单调博弈的连续博弈)背景下,且玩家仅能访问各自收益梯度的噪声估计时研究该问题。若噪声为加性,则博弈论与纯对抗设定的遗憾保证相近;然而若噪声为乘性,我们表明学习者实际上可实现常数遗憾。我们通过一种具有学习率分离的乐观梯度方案实现此更快速率——即该方法的外推与更新步骤依据噪声轮廓被调至不同时间表。随后,为消除精细超参数调优之需,我们提出一种完全自适应方法,其在不知晓博弈或噪声轮廓的情况下,取得与其非自适应对应方法几乎相同的保证。
引用
@article{arxiv.2206.06015,
title = {No-Regret Learning in Games with Noisy Feedback: Faster Rates and Adaptivity via Learning Rate Separation},
author = {Yu-Guan Hsieh and Kimon Antonakopoulos and Volkan Cevher and Panayotis Mertikopoulos},
journal= {arXiv preprint arXiv:2206.06015},
year = {2023}
}
备注
In Advances in Neural Information Processing Systems 35 (NeurIPS 2022)