中文

具有 Bandit 反馈与对手动作的零和博弈的近最优末轮迭代收敛

机器学习 2026-05-12 v1

摘要

博弈中学习动态的末轮迭代收敛近期引起了广泛关注。在具有 bandit 反馈的两人零和博弈中,仅能观察到所选动作对的损失,Fiegel 等人 (2025) 展示了对偶间隙中平均迭代与末轮迭代收敛之间的分离:前者通过标准无悔算法在 t 轮后可实现最优的 t1/2t^{-1/2} 速率,而后者在期望下不能快于 t1/3t^{-1/3} 或在高概率下快于 t1/4t^{-1/4} 收敛。然而,在许多实际场景中(如偏好学习),参与者不仅观察到自身的损失,还观察到对手的动作。这引发了一个自然问题:这种额外信息能否实现更快的末轮迭代收敛?我们肯定地回答了这个问题,表明在此设置下高概率地实现 t1/2t^{-1/2} 的末轮迭代收敛是可行的,其通过一种高效算法实现,该算法通过求解估计的对数障碍正则化博弈来不频繁地更新其策略。我们识别了阻碍多臂赌博机(即单人博弈情形)的标准分析推广到博弈中的根本障碍,并开发了一种新颖的分析来克服它们。实验证实,我们的算法确实比朴素基线和未利用对手动作反馈的现有方法收敛得更快。最后,我们注意到我们的结果同样改进了对偶赌博机(一种具有斜对称博弈矩阵的特殊情形)的相关结论。

关键词

引用

@article{arxiv.2605.09363,
  title  = {Near-Optimal Last-Iterate Convergence for Zero-Sum Games with Bandit Feedback and Opponent Actions},
  author = {Soumita Hait and Ping Li and Haipeng Luo and Mengxiao Zhang},
  journal= {arXiv preprint arXiv:2605.09363},
  year   = {2026}
}