重新思考目标条件监督学习及其与离线 RL 的联系
机器学习
2022-02-15 v2 人工智能
摘要
利用自监督学习以稀疏奖励解决目标条件任务颇具前景,因其相较当前强化学习(RL)算法具有简洁性与稳定性。近期一项称为目标条件监督学习(GCSL)的工作通过迭代重标与模仿自生成经验提供了一种新学习框架。本文中,我们重新审视 GCSL 的理论性质——优化目标到达目标的下界,并将 GCSL 扩展为一种新颖的离线目标条件 RL 算法。所提方法命名为加权 GCSL(WGCSL),其中我们引入一种由三部分组成的先进复合权重:(1)用于目标重标的折扣权重,(2)目标条件指数优势权重,以及(3)最佳优势权重。理论上,WGCSL 被证明优化目标条件 RL 目标的等价下界,并通过迭代方案生成单调改进的策略。该单调性质对任意行为策略成立,因此 WGCSL 可应用于在线与离线设置。为在离线目标条件 RL 设置下评估算法,我们提供了一个包含一系列点位与模拟机器人领域的基准。在所引入基准中的实验表明,WGCSL 在完全离线目标条件设置下能持续优于 GCSL 与现有最先进的离线方法。
引用
@article{arxiv.2202.04478,
title = {Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL},
author = {Rui Yang and Yiming Lu and Wenzhe Li and Hao Sun and Meng Fang and Yali Du and Xiu Li and Lei Han and Chongjie Zhang},
journal= {arXiv preprint arXiv:2202.04478},
year = {2022}
}
备注
Accepted by International Conference on Learning Representations (ICLR) 2022