离线强化学习中从单个任务发现多个解
机器学习
2024-06-11 v1 机器学习
摘要
最近的研究表明,从单个任务学习多个行为在在线强化学习(RL)中具有优势,例如在针对新环境进行few-shot适应时。虽然这种方法在离线 RL 中也被期望获得类似好处,但以往的研究并未充分调查学习多个解的方法。在本研究中,我们因此解决了在离线 RL 中从单个任务中寻找多个解的问题。我们提出了能够在离线 RL 中学习多个解的算法,并经验性地调查了其性能。我们的实验结果表明,提出的算法在离线 RL 中学习到多个在质量和数量上都有显著区别的解。
引用
@article{arxiv.2406.05993,
title = {Discovering Multiple Solutions from a Single Task in Offline Reinforcement Learning},
author = {Takayuki Osa and Tatsuya Harada},
journal= {arXiv preprint arXiv:2406.05993},
year = {2024}
}
备注
ICML 2024, 21 pages