中文

真实世界中的统计强化学习:挑战与未来方向综述

应用统计 2026-01-23 v1 机器学习 机器学习

摘要

强化学习(RL)在游戏、机器人、在线广告、公共健康和自然语言处理等多个领域的现实世界决策中取得了显著成功。尽管取得了这些进展,RL 研究与其在许多实际场景中的部署之间仍存在巨大差距。这一差距背后通常潜藏着两个反复出现的挑战。首先,由于实际限制,在许多场景下,智能体与目标环境进行广泛交互的机会有限。其次,许多目标环境经常发生重大变化,需要对 RL 系统进行重新设计和重新部署(例如,改变医疗保健服务格局的科技进步)。要应对这些挑战并弥合基础研究与应用之间的差距,需要能够直接指导现实场景中 RL 系统的设计、实现和持续改进的理论与方法。在本文中,我们将实践中 RL 的应用构建为一个三阶段过程:(i) 部署期间的在线学习与优化,(ii) 部署后或部署间的离线分析,以及 (iii) 部署与重新部署的重复循环,以持续改进 RL 系统。我们对统计强化学习领域应对这些组成部分的最新进展进行了叙述性综述,包括最大化部署间推断的数据利用率的方法、增强部署内在线学习样本效率的方法,以及为持续改进而设计部署序列的方法。我们还概述了统计强化学习中以应用为驱动的未来研究方向,旨在推动 RL 在实践中的产生影响力的应用。

关键词

引用

@article{arxiv.2601.15353,
  title  = {Statistical Reinforcement Learning in the Real World: A Survey of Challenges and Future Directions},
  author = {Asim H. Gazi and Yongyi Guo and Daiqi Gao and Ziping Xu and Kelly W. Zhang and Susan A. Murphy},
  journal= {arXiv preprint arXiv:2601.15353},
  year   = {2026}
}