中文

离线目标条件强化学习的未见目标泛化究竟需要什么?

机器学习 2023-06-05 v2 人工智能

摘要

离线目标条件强化学习(GCRL)提供了一种从完全离线数据集中训练通用智能体的途径。除了在数据集内保持保守外,实现未见目标的泛化能力是离线 GCRL 的另一基本挑战。然而,据我们所知,该问题尚未得到充分研究。本文从理论与实证两方面研究离线 GCRL 的分布外(OOD)泛化,以识别其中的重要因素。在大量实验中,我们观察到加权模仿学习比基于悲观的离线 RL 方法具有更好的泛化能力。基于该洞见,我们推导了 OOD 泛化理论,刻画了若干重要的设计选择。随后,结合理论与实证研究结论,我们提出一种新的离线 GCRL 方法——可泛化离线目标条件强化学习(GOAT)。在一个包含 9 个独立同分布(IID)任务与 17 个 OOD 任务的新基准上,GOAT 大幅优于当前最优方法。

关键词

引用

@article{arxiv.2305.18882,
  title  = {What is Essential for Unseen Goal Generalization of Offline Goal-conditioned RL?},
  author = {Rui Yang and Yong Lin and Xiaoteng Ma and Hao Hu and Chongjie Zhang and Tong Zhang},
  journal= {arXiv preprint arXiv:2305.18882},
  year   = {2023}
}

备注

Accepted by International Conference on Machine Learning (ICML), 2023