强化学习在经济学中的综述
综合经济学
2026-03-25 v5 机器学习
经济学
摘要
本综述(复)介绍了强化学习方法以供经济学家使用。维度灾难限制了精确动态规划能够有效应用的范围,迫使我们依赖 suitably "小"问题,或将 "大"问题转化为更小问题的能力。在许多经典应用中,这种化简已足够,但日益增长的经济模型模型抵抗了这种化简。强化学习算法提供了动态编程的自然、基于样本的扩展,使高维状态、连续动作和战略互动的问题变得可计算。我审查了将经典规划与现代学习算法相连接的理论,并通过定价、库存控制、战略游戏和偏好探索中的仿真示例展示了其机制。我还检查了这些算法的实际漏洞,指出其脆弱性、样本效率低、对超参数的敏感性,以及在非表格设置下缺乏全局收敛性保证。尽管如此,强化学习的成功仍严格受制于这些限制,以及对准确模拟器的依赖。当引导经济结构时,强化学习提供了一个相当灵活的框架。它是一种不完美但有前景的计算经济学家工具箱的补充。一本随附的综述(Rust 和 Rawat,2026b)涵盖了从观察行为中推断偏好的逆问题。所有仿真代码均公开可用。
引用
@article{arxiv.2603.08956,
title = {A Survey of Reinforcement Learning For Economics},
author = {Pranjal Rawat},
journal= {arXiv preprint arXiv:2603.08956},
year = {2026}
}