中文

从原始-对偶视角探索:基于价值激励的演员-评论家方法用于高效在线强化学习

机器学习 2025-06-30 v1 最优化与控制

摘要

在人工智能的现代实践中,针对transformers和深度神经网络等复杂函数逼近技术的在线强化学习(RL)发挥着重要作用。尽管该方法广受欢迎且重要,但在探索与开发作基本权衡方面仍面临长期挑战;特别是我们仍缺乏由理论性能保证支撑的高效且实用的方案。针对通过乐观正则化实现的探索的最新进展,本文通过原始-对偶优化视角解释乐观原则。从这一全新视角出发,我们提出了一种价值激励式演员-评论家(VAC)方法,该方法优化单个易于优化的目标,集成探索与开发——它促进与收集的数据转换相一致的状态-动作和策略估计,同时导致更高的价值函数。理论上,所提出的VAC方法在线性马尔可夫决策过程(MDPs)中的有限时限和无限时限设置下都具有近最优后悔保证,可推广到一般函数逼近设置下。

关键词

引用

@article{arxiv.2506.22401,
  title  = {Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL},
  author = {Tong Yang and Bo Dai and Lin Xiao and Yuejie Chi},
  journal= {arXiv preprint arXiv:2506.22401},
  year   = {2025}
}