在线鞍点问题的准近似点法
机器学习
2025-06-27 v3 最优化与控制
摘要
本文聚焦于在线鞍点问题,这涉及一系列两个玩家的时间可变凸凹游戏。鉴于环境的非平稳性,我们采用鸿沟和动态纳什均衡失效作为算法设计的绩效指标。我们提出了三种准近似点法的变体:在线准近似点法(OPPM)、乐观 OPPM(OptOPPM)以及带有多个预测器的 OptOPPM。每个算法都保证鸿沟和动态纳什均衡失效的上界,达到近最优水平。具体而言,在某些温和环境中(如 stationary payoff 函数的序列),这些算法保持近乎恒定的度量界限。实验结果进一步验证了这些算法的有效性。最后,本文讨论了将动态纳什均衡失效作为绩效指标使用的潜在可靠性问题。技术附录和代码可在 https://github.com/qingxin6174/PPM-for-OSP 获取。
引用
@article{arxiv.2407.04591,
title = {Proximal Point Method for Online Saddle Point Problem},
author = {Qing-xin Meng and Jian-wei Liu},
journal= {arXiv preprint arXiv:2407.04591},
year = {2025}
}