鲁棒深度蒙特卡洛反事实遗憾最小化:应对神经虚拟自博弈中的理论风险
人工智能
2026-01-29 v2 计算机科学与博弈论
机器学习
摘要
蒙特卡洛反事实遗憾最小化(MCCFR)已成为求解扩展形式博弈的基石算法,但其与深度神经网络的集成引入了随游戏规模不同而表现不同的规模依赖挑战。本文对神经 MCCFR 组件有效性如何随游戏规模变化进行了全面分析,并提出了自适应选择性组件部署框架。我们识别出理论风险,如非平稳目标分布偏移、动作支撑坍塌、方差爆炸和预热偏差,具有规模依赖的表现模式,需要针对小规模和大规模游戏采用不同的缓解策略。我们提出的鲁棒深度 MCCFR 框架集成了带延迟更新的目标网络、均匀探索混合、方差感知训练目标以及全面的诊断监控。通过在 Kuhn 和 Leduc 扑克上的系统性消融研究,我们展示了规模依赖的组件有效性并识别了关键的组件交互。最佳配置在 Kuhn 扑克上实现了 0.0628 的最终可利用性,较经典框架(0.156)提升了 60%。在更复杂的 Leduc 扑克领域,选择性组件使用实现了 0.2386 的可利用性,较经典框架(0.3703)提升了 23.5%,凸显了仔细组件选择而非全面缓解的重要性。我们的贡献包括:(1) 神经 MCCFR 中风险的形式理论分析,(2) 具有收敛保证的原则性缓解框架,(3) 揭示规模依赖组件交互的全面多尺度实验验证,以及 (4) 在更大游戏中部署的实用指南。
引用
@article{arxiv.2509.00923,
title = {Robust Deep Monte Carlo Counterfactual Regret Minimization: Addressing Theoretical Risks in Neural Fictitious Self-Play},
author = {Zakaria El Jaafari},
journal= {arXiv preprint arXiv:2509.00923},
year = {2026}
}
备注
There seems to be some errors related to the encountered problems and the interpreation of numerical results, that do not have a common pattern