中文

无需重训练即可改进智能体:带离策略修正的并行树搜索

人工智能 2023-02-07 v3

摘要

树搜索(TS)对一些最具影响力的强化学习成功案例至关重要。在此,我们解决限制 TS 可用性的两个主要挑战:分布偏移(distribution shift)与可扩展性(scalability)。我们首先发现并分析了一个反直觉现象:通过 TS 与预训练价值函数进行动作选择,即使能获取未来步骤的精确状态与奖励,其性能也常低于原始预训练智能体。我们表明这是由于分布偏移到了价值估计极不准确的区域,并利用极值理论(Extreme Value theory)分析了该效应。为克服此问题,我们引入一种新颖的离策略修正项(off-policy correction term),通过对欠采样轨迹进行惩罚,来考量预训练价值与其对应 TS 策略之间的不匹配。我们证明该修正消除了上述不匹配,并界定了次优动作选择的概率。我们的修正显著改进了预训练的 Rainbow 智能体而无需任何进一步训练,在 Atari 游戏上常将其分数提升一倍以上。接下来,我们解决由随树深度指数级增长的计算复杂度所导致的穷举 TS 的可扩展性问题。我们引入 Batch-BFS:一种 GPU 广度优先搜索,可同时推进树中每一层的所有节点。Batch-BFS 将运行时间减少两个数量级,并且除推理外,还支持此前不可行的深度的 TS 训练。我们使用 TS 从头训练 DQN 智能体,并展示其在多个 Atari 游戏上相比原始 DQN 与更先进的 Rainbow 均有提升。BCTS 的代码见 \url{https://github.com/NVlabs/bcts}。

关键词

引用

@article{arxiv.2107.01715,
  title  = {Improve Agents without Retraining: Parallel Tree Search with Off-Policy Correction},
  author = {Assaf Hallak and Gal Dalal and Steven Dalton and Iuri Frosio and Shie Mannor and Gal Chechik},
  journal= {arXiv preprint arXiv:2107.01715},
  year   = {2023}
}