平均场博弈中的最大因果熵逆强化学习与用于前向强化学习的广义纳什均衡问题框架
系统与控制
2025-07-22 v2 机器学习
系统与控制
最优化与控制
摘要
本文探讨了在具有有限状态空间和无限时域折扣奖励设置的离散时间稳态平均场博弈(MFG)背景下,最大因果熵逆强化学习(IRL)的应用。尽管由此产生的优化问题关于策略是非凸的,但我们通过利用马尔可夫决策过程的线性规划框架,将其重新表述为关于状态-动作占有测度的凸优化问题。基于此凸重构,我们引入了一种具有保证收敛速率的梯度下降算法,以高效计算最优解。此外,我们开发了一种新方法,将MFG问题概念化为广义纳什均衡问题(GNEP),从而能够有效计算前向强化学习(RL)问题的平均场均衡,标志着MFG求解技术的进步。我们进一步通过使用该算法为数值MFG示例生成数据,展示了我们GNEP方法的实际适用性。
引用
@article{arxiv.2401.06566,
title = {Maximum Causal Entropy IRL in Mean-Field Games and GNEP Framework for Forward RL},
author = {Berkay Anahtarci and Can Deha Kariksiz and Naci Saldi},
journal= {arXiv preprint arXiv:2401.06566},
year = {2025}
}
备注
40 pages