中文

通过 KL 正则化实现通用和-sum 游戏的乐观无关离线学习

机器学习 2026-05-19 v2 计算机科学与博弈论

摘要

一般和-sum 环境下的离线多智能体强化学习面临日志数据与目标均衡策略之间的分布迁移问题。虽然标准方法依赖手动的悲观惩罚,但我们展示了 KL 正则化足以稳定学习并实现均衡恢复。我们提出了 General-sum Anchored Nash Equilibrium(GANE),它以加速的统计速率 O~(1/n)\widetilde{O}(1/n) 恢复正则化纳什均衡。对于计算可行性,我们开发了 General-sum Anchored Mirror Descent(GAMD),一种收敛于粗相关均衡的迭代算法,收敛速率为 O~(1/n+1/T)\widetilde{O}(1/\sqrt{n}+1/T)。这些结果表明,KL 正则化作为一种独立的乐观无关离线学习机制,可在多玩家一般和-sum 游戏中实现等效或加速的速率。

关键词

引用

@article{arxiv.2605.00264,
  title  = {Pessimism-Free Offline Learning in General-Sum Games via KL Regularization},
  author = {Claire Chen and Yuheng Zhang},
  journal= {arXiv preprint arXiv:2605.00264},
  year   = {2026}
}