探索强化:基于强化学习的均衡近似
机器学习
2024-12-04 v1 人工智能
计算机科学与博弈论
摘要
当前的近似粗相关均衡(CCE)算法在大型随机环境下的均衡近似效果不佳,却在理论上保证收敛到强解概念。相比之下,现代强化学习(RL)算法训练更快,但产生的解更弱。我们提出 Exp3-IXrl ——一种结合 RL 与博弈论方法的算法,将 RL 代理的动作选择与均衡计算分离,同时保持学习过程的完整性。我们展示了该算法将均衡近似算法的应用扩展到新环境。具体而言,我们在复杂且对抗性的网络安全环境——Cyber Operations Research Gym 中以及经典的多臂老虎机设置中表现出改进性能。
引用
@article{arxiv.2412.02016,
title = {Explore Reinforced: Equilibrium Approximation with Reinforcement Learning},
author = {Ryan Yu and Mateusz Nowak and Qintong Xie and Michelle Yilin Feng and Peter Chin},
journal= {arXiv preprint arXiv:2412.02016},
year = {2024}
}