中文

对比扩散器:通过对比学习规划至高回报状态

机器学习 2024-06-18 v3

摘要

离线强化学习(RL)的性能对离线数据集中高回报轨迹的比例敏感。然而,在许多模拟环境和现实场景中,低回报轨迹的比例远高于高回报轨迹,这使得学习高效策略具有挑战性。本文提出了一种名为对比扩散器(Contrastive Diffuser, CDiffuser)的方法,以充分利用低回报轨迹并提高离线RL算法的性能。具体来说,CDiffuser将离线数据集中的轨迹状态分为高回报状态和低回报状态,并分别将其视为正样本和负样本。然后,它设计了一种对比机制,将智能体的轨迹拉向高回报状态,并推离低回报状态。通过对比机制,低回报轨迹可以作为策略学习的负例,引导智能体避免与低回报相关的区域,从而实现更好的性能。在14个常用的D4RL基准上的实验证明了我们提出方法的有效性。我们的代码公开在\url{https://anonymous.4open.science/r/CDiffuser}。

关键词

引用

@article{arxiv.2402.02772,
  title  = {Contrastive Diffuser: Planning Towards High Return States via Contrastive Learning},
  author = {Yixiang Shan and Zhengbang Zhu and Ting Long and Qifan Liang and Yi Chang and Weinan Zhang and Liang Yin},
  journal= {arXiv preprint arXiv:2402.02772},
  year   = {2024}
}

备注

18 pages with appendix and references, 10 figures, 4 tables