基于不确定性与时间距离感知课程目标生成的面向结果强化学习
机器学习
2023-02-21 v3 人工智能
机器人学
摘要
当前的强化学习(RL)在解决具有挑战性的探索问题时常常表现不佳,其中期望结果或高奖励很少被观测到。尽管课程 RL 作为一种通过提出一系列替代任务来解决复杂任务的框架展现出合理的结果,但以往大多数工作仍难以提出课程,因为缺乏一种在无任何先验领域知识情况下获得指向期望结果状态的校准引导的机制。为缓解此问题,我们提出了一种面向结果 RL 的不确定性与时间距离感知课程目标生成方法,通过求解二部匹配问题实现。该方法不仅能提供指向期望结果状态的精确校准课程引导,而且与以往课程 RL 方法相比,带来了更好的样本效率以及与几何无关的课程目标提议能力。我们以定量与定性方式证明,我们的算法在多种具有挑战性的导航任务与机器人操作任务中显著优于这些先前方法。
引用
@article{arxiv.2301.11741,
title = {Outcome-directed Reinforcement Learning by Uncertainty & Temporal Distance-Aware Curriculum Goal Generation},
author = {Daesol Cho and Seungjae Lee and H. Jin Kim},
journal= {arXiv preprint arXiv:2301.11741},
year = {2023}
}
备注
ICLR 2023 Spotlight. First two authors contributed equally