中文

多样化与征服:基于分布外不一致性的结果导向课程强化学习

机器学习 2023-10-31 v1

摘要

强化学习(RL)常常面临无信息搜索问题的挑战,即智能体应在无法获取领域知识(如环境特征或外部奖励)的情况下进行探索。为应对这些挑战,本文提出一种称为“为不一致性而多样化并征服”(D2C)的课程 RL 新方法。与先前的课程学习方法不同,D2C 仅需少量期望结果示例,且适用于任意环境,无论其几何结构或期望结果示例的分布如何。所提方法对目标条件分类器进行多样化,以识别已访问状态与期望结果状态之间的相似性,并确保分类器对来自分布外(out-of-distribution)的状态持不一致意见,从而能够以简单直观的方式量化未探索区域并设计任意目标条件内在奖励信号。该方法随后采用二分匹配来定义课程学习目标,生成一系列调整良好的中间目标,使智能体能够自动探索并征服未探索区域。我们给出的实验结果表明,即使在任意分布的期望结果示例下,D2C 在定量与定性方面均优于先前的课程 RL 方法。

关键词

引用

@article{arxiv.2310.19261,
  title  = {Diversify & Conquer: Outcome-directed Curriculum RL via Out-of-Distribution Disagreement},
  author = {Daesol Cho and Seungjae Lee and H. Jin Kim},
  journal= {arXiv preprint arXiv:2310.19261},
  year   = {2023}
}