中文

信任区域扭转策略改进

机器学习 2025-07-09 v4

摘要

蒙特卡洛树搜索(MCTS)驱动了深度强化学习(RL)中的许多最新突破。然而,将MCTS扩展到并行计算在实际中一直具有挑战,这促使采用类似顺序蒙特卡洛(SMC)的方法。许多这些SMC方法采用粒子滤波器进行平滑处理,通过将RL重新表述为策略推断问题来实现。然而,这些粒子滤波器的持续设计选择往往与RL在规划开始时获取策略改进的目标相冲突。着眼于MCTS,我们为RL定制SMC规划器,通过受限动作抽样和显式终端状态处理来改进数据生成,以及改进策略和价值目标估计。这导致我们的信任区域扭转SMC(TRT-SMC),在离散和连续域中均显示出比基准MCTS和SMC方法更好的运行时性能和样本效率。

关键词

引用

@article{arxiv.2504.06048,
  title  = {Trust-Region Twisted Policy Improvement},
  author = {Joery A. de Vries and Jinke He and Yaniv Oren and Matthijs T. J. Spaan},
  journal= {arXiv preprint arXiv:2504.06048},
  year   = {2025}
}

备注

Poster at ICML2025