中文

离线强化学习中从单个任务发现多个解

机器学习 2024-06-11 v1 机器学习

摘要

最近的研究表明,从单个任务学习多个行为在在线强化学习(RL)中具有优势,例如在针对新环境进行few-shot适应时。虽然这种方法在离线 RL 中也被期望获得类似好处,但以往的研究并未充分调查学习多个解的方法。在本研究中,我们因此解决了在离线 RL 中从单个任务中寻找多个解的问题。我们提出了能够在离线 RL 中学习多个解的算法,并经验性地调查了其性能。我们的实验结果表明,提出的算法在离线 RL 中学习到多个在质量和数量上都有显著区别的解。

关键词

引用

@article{arxiv.2406.05993,
  title  = {Discovering Multiple Solutions from a Single Task in Offline Reinforcement Learning},
  author = {Takayuki Osa and Tatsuya Harada},
  journal= {arXiv preprint arXiv:2406.05993},
  year   = {2024}
}

备注

ICML 2024, 21 pages