中文

基于智能切换的重置自由强化学习

机器学习 2024-05-06 v1 人工智能

摘要

在现实世界中,训练仿真环境中所需的强烈剧集重置机制是不可用的。重置\textit{重置}假设限制了强化学习在现实世界中的潜力,因为为智能体提供重置通常需要创建额外的手工机制或人工干预。最近的工作旨在以所学重置方式训练智能体 (前向\textit{前向}),通过构建第二个 (后向\textit{后向}) 智能体来将前向智能体返回初始状态。我们发现,这两种智能体之间的转换的终止和时机对于算法成功至关重要。基于此,我们创建了一种新算法,即基于智能切换控制器的重置自由强化学习 (RISC),该算法根据智能体在实现其当前目标方面的置信度智能地在两种智能体之间切换。我们新方法在几个具有挑战性的重置自由强化学习环境中实现了最先进的性能。

关键词

引用

@article{arxiv.2405.01684,
  title  = {Intelligent Switching for Reset-Free RL},
  author = {Darshan Patil and Janarthanan Rajendran and Glen Berseth and Sarath Chandar},
  journal= {arXiv preprint arXiv:2405.01684},
  year   = {2024}
}

备注

Published at ICLR 2024