二阶镜像下降:超越平均与折扣的游戏收敛性
最优化与控制
2024-10-28 v4 计算机科学与博弈论
机器学习
系统与控制
系统与控制
动力系统
摘要
本文中,我们提出连续时间博弈论镜像下降(MD)动力学的二阶扩展,称为 MD2,它可证明地收敛到单纯(但不必严格)变分稳定态(VSS),而无需使用时间平均或折扣等常见辅助技术。我们表明,经轻微修改后,MD2 具有无遗憾性以及对强 VSS 的指数收敛速率。MD2 也可用于推导许多新颖的连续时间原空间动力学。随后我们利用随机逼近技术,为带噪声观测的离散时间 MD2 朝向内部单纯 VSS 的收敛提供保证。文中给出精选仿真以阐明我们的结果。
引用
@article{arxiv.2111.09982,
title = {Second-Order Mirror Descent: Convergence in Games Beyond Averaging and Discounting},
author = {Bolin Gao and Lacra Pavel},
journal= {arXiv preprint arXiv:2111.09982},
year = {2024}
}
备注
16 pages, 12 figures. This work has been submitted to the IEEE for possible publication