中文

SMORE:面向离线目标条件强化学习的分数模型

机器学习 2024-03-01 v2 人工智能 机器人学

摘要

离线目标条件强化学习(GCRL)的任务是在环境中仅利用离线数据集和稀疏奖励函数来学习实现多个目标。离线 GCRL 对于开发能够利用预存数据集学习多样且可复用技能而无需手工设计奖励函数的通用智能体至关重要。然而,基于监督学习和对比学习的当代 GCRL 方法在离线设定下往往并非最优。GCRL 的另一种视角优化占用匹配,但需要学习一个判别器,该判别器随后作为下游 RL 的伪奖励。所学判别器中的误差会级联传播,对所得策略产生负面影响。我们提出了一种在混合分布匹配新视角下的 GCRL 方法,从而导出我们的无判别器方法:SMORe。其核心洞见是将 GCRL 的占用匹配视角与凸对偶形式相结合,以推导出一个能更好利用次优离线数据的学习目标。SMORe 学习表示在某一状态下采取某动作以到达特定目标的重要性的分数或非归一化密度。SMORe 具有理论依据,我们在由机器人操控与运动任务(包括高维观测)组成的全离线 GCRL 基准上的大量实验表明,SMORe 能大幅优于最先进的基线方法。

关键词

引用

@article{arxiv.2311.02013,
  title  = {SMORE: Score Models for Offline Goal-Conditioned Reinforcement Learning},
  author = {Harshit Sikchi and Rohan Chitnis and Ahmed Touati and Alborz Geramifard and Amy Zhang and Scott Niekum},
  journal= {arXiv preprint arXiv:2311.02013},
  year   = {2024}
}

备注

Published at International Conference of Learning Representations (ICLR) 2024. 26 pages