中文

基于自适应奖励转换实现后迭代收敛的高效遗憾最小化

计算机科学与博弈论 2025-09-18 v1 机器学习

摘要

遗憾最小化是寻找正则形式游戏(NFGs)和广义形式游戏(EFGs)纳什均衡的强大方法,但通常仅保证平均策略的收敛。然而,计算平均策略需要大量计算资源或引入额外误差,限制了其实际应用。奖励转换(Reward Transformation, RT)框架曾用于遗憾最小化,以通过奖励函数正则化实现后迭代收敛。然而,该方法面临实际挑战:其性能高度依赖手动调参参数,而这些参数常偏离理论收敛条件,导致收敛缓慢、振荡或陷入局部最优。针对此问题,我们提出一种自适应技术,确保 RT 遗憾匹配(RTRM)、RT 反向计算遗憾最小化(RTCFR)及其变体在解决 NFG 和 EFG 时更加有效。我们的自适应方法动态调整参数,在探索与开发之间取得平衡,提高遗憾积累,最终增强渐近后迭代收敛并实现线性收敛。实验结果表明,我们的方法显著加快收敛速度,超越当前最先进算法。

关键词

引用

@article{arxiv.2509.13653,
  title  = {Efficient Last-Iterate Convergence in Regret Minimization via Adaptive Reward Transformation},
  author = {Hang Ren and Yulin Wu and Shuhan Qi and Jiajia Zhang and Xiaozhen Sun and Tianzi Ma and Xuan Wang},
  journal= {arXiv preprint arXiv:2509.13653},
  year   = {2025}
}